{"as_of":"2026-08-14T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3d6f49fb5f6eeb3ca9bb2968f7ab4fa02a912c56eedbc52de13eb5e47bd244a0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:29:35.371817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T02:44:27.641390Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:73be33d31598892ea9ca62144df28124df538df58ae856b0629d5465bc792db1","observation_id":"e7bc3476-42d1-48eb-a25f-60a498b89f61","resolution":{"observed_at":"2026-05-16T02:56:41.946901Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T19:11:33.783746Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2310.03744"},"observation_digest":"sha256:bea94ddaca928b5f33481d357255f52121935fe506ae4a67759893845146d645","observation_id":"e800d743-7f54-4c14-9bca-fbd2d8db1d48","resolution":{"observed_at":"2026-05-12T19:11:33.878106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:16447472383a0652bd89a287b3a80c1904febefc4e9dada2d359d50861416ebd","observation_id":"440c846a-a9c6-47c4-a20a-2a8032f7999a","resolution":{"observed_at":"2026-05-13T22:46:09.950334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-05-15T16:35:47.826165Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2312.17090"},"observation_digest":"sha256:d03c22118c0d40f8be2920903c86163153f71b167a83fc61965da4b66afb429f","observation_id":"74b58cc9-8d61-4a47-9fe9-799368bf3e75","resolution":{"observed_at":"2026-05-15T16:35:48.066345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T02:33:30.143907Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2401.15947"},"observation_digest":"sha256:e9880b5c4d5edd76ecfa69307520119bb561fd6215d56f0d2466d79d24464c6c","observation_id":"99565bf8-9a88-4cd7-a99c-c54b89af5064","resolution":{"observed_at":"2026-05-16T02:33:30.320280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:cb54ab06d821ee813824f3eba9ae4a86b35ea4deb877f736895630506f114c5b","observation_id":"f2f92ab5-4202-4cf0-a0bd-328334a5928e","resolution":{"observed_at":"2026-05-18T15:27:52.005910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:1febd468bd458e2612ad36994f5448ef774b3451e288e91136305803b40f085e","observation_id":"3b836275-5181-4428-b431-2b6e90226b10","resolution":{"observed_at":"2026-05-16T04:09:36.331924Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:919a0f622a59d1be93c3c94fa21ee6b64ad4e42b403329d59a5abeb905afc02b","observation_id":"e25276ac-475d-41b5-9f0b-b2043af2d0a1","resolution":{"observed_at":"2026-05-17T07:44:47.401414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:5284d4c5b283a0df5912ca7518decac150cf846b440a2cbdd1fbc1081b75db9e","observation_id":"90548e61-3ef4-40fe-99a3-20453b93b910","resolution":{"observed_at":"2026-05-12T20:58:59.004457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:e3bee35e4003fea48144191138b67a53e2320ffe938b5564028fa6f88294634b","observation_id":"d9973341-a54d-4963-89ee-fdaeb533ec6d","resolution":{"observed_at":"2026-05-11T12:33:33.904702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T21:29:35.371817Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08715","last_updated":"2024-12-09T11:56:00Z","snapshot_observed_at":"2026-08-12T21:23:41.283233Z","submitted_at":"2024-11-13T15:58:50Z","title":"Retrieval Augmented Recipe Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T21:29:35.371817Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.08715"},"observation_digest":"sha256:ca99a4f1dbf4d360e4fe8cd578766a6d94b8b13344f6fb63c5b4166221ea2831","observation_id":"16432e8c-11ae-4110-8cbf-15c8e11bc4ab","resolution":{"observed_at":"2026-08-12T21:29:35.371817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T20:13:46.439797Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09921","last_updated":"2025-04-04T03:20:03Z","snapshot_observed_at":"2026-08-12T23:41:29.133048Z","submitted_at":"2024-11-15T03:45:09Z","title":"Motion-Grounded Video Reasoning: Understanding and Perceiving Motion at Pixel Level","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:46.439797Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.09921"},"observation_digest":"sha256:ee543c74c2d9858290fddb9cc9277fa532da43cd906188044f6f590d93ed306e","observation_id":"57d4be7d-a371-4c96-8e2e-ccfd64ff52f3","resolution":{"observed_at":"2026-08-12T20:13:46.439797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T20:10:24.652762Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09955","last_updated":"2024-11-21T05:28:10Z","snapshot_observed_at":"2026-08-13T15:42:46.629783Z","submitted_at":"2024-11-15T05:18:15Z","title":"Instruction-Guided Editing Controls for Images and Multimedia: A Survey in LLM era","version":2},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-08-12T20:10:24.652762Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.09955"},"observation_digest":"sha256:065d87c2e9eb1f939c74570189ae064e29fbb80422669389c5d07cb0da2d2670","observation_id":"4001b619-8fb9-4b15-9588-efb73c8522e5","resolution":{"observed_at":"2026-08-12T20:10:24.652762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T12:19:22.472727Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17323","last_updated":"2024-11-26T11:11:10Z","snapshot_observed_at":"2026-08-12T14:26:44.775367Z","submitted_at":"2024-11-26T11:11:10Z","title":"InsightEdit: Towards Better Instruction Following for Image Editing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:19:22.472727Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.17323"},"observation_digest":"sha256:5bf8fc7f68d5179890e1074c506cf575a07e9eb5727269593bfbd90fa4a6b1e8","observation_id":"2f37db29-59a6-42d9-bc99-caed9a1506e3","resolution":{"observed_at":"2026-08-12T12:19:22.472727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T12:03:54.124205Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17606","last_updated":"2024-12-02T03:19:04Z","snapshot_observed_at":"2026-08-13T21:35:43.932778Z","submitted_at":"2024-11-26T17:18:20Z","title":"HyperSeg: Towards Universal Visual Segmentation with Large Language Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:03:54.124205Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.17606"},"observation_digest":"sha256:c56ea2b65c455c4ae690635b254fa0c3fdd7fdafc11724e4566edd78171cfca2","observation_id":"2e9ac932-b0fd-48a0-875c-929d4c08e1b0","resolution":{"observed_at":"2026-08-12T12:03:54.124205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T11:19:33.570163Z","title":"Lisa: Reasoning seg- mentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-13T21:40:49.922514Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.570163Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:bc8aac9cb87550a613089439dc2fc6706b78f5c90f131920087267635177eafe","observation_id":"abd9a563-b0ef-4a01-992e-f118bbf77b27","resolution":{"observed_at":"2026-08-12T11:19:33.570163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-11T23:50:37.036030Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.02158","last_updated":"2024-12-04T08:34:49Z","snapshot_observed_at":"2026-08-12T14:25:50.767875Z","submitted_at":"2024-12-03T04:34:23Z","title":"Agri-LLaVA: Knowledge-Infused Large Multimodal Assistant on Agricultural Pests and Diseases","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:50:37.036030Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2412.02158"},"observation_digest":"sha256:46d5ead6af77d4214791c274e810288b32393b7c75f051f79ce773049dde2d37","observation_id":"c081d1cf-2291-40a6-add3-b52aaad0501a","resolution":{"observed_at":"2026-08-11T23:50:37.036030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-11T22:07:33.053665Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03809","last_updated":"2024-12-05T02:05:33Z","snapshot_observed_at":"2026-08-12T04:53:08.360861Z","submitted_at":"2024-12-05T02:05:33Z","title":"EditScout: Locating Forged Regions from Diffusion-based Edited Images with Multimodal LLM","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:07:33.053665Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2412.03809"},"observation_digest":"sha256:6ff028e48d4f8b35670807573a0ece6c92746fee448551a0c196c58404ed45cd","observation_id":"948e5ad0-0b29-4ebc-b27c-8d4548f9c9af","resolution":{"observed_at":"2026-08-11T22:07:33.053665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-11T22:02:03.848908Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03937","last_updated":"2025-04-05T21:29:28Z","snapshot_observed_at":"2026-08-12T01:26:22.136343Z","submitted_at":"2024-12-05T07:35:19Z","title":"AIpparel: A Multimodal Foundation Model for Digital Garments","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:02:03.848908Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2412.03937"},"observation_digest":"sha256:11f91ce337a2e4887c424504058942fb81700e47aa041a18ff8284f8b2e9cbf1","observation_id":"c37f5ad3-671c-4868-afa1-58cd9c28b6cf","resolution":{"observed_at":"2026-08-11T22:02:03.848908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-11T12:37:59.529983Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14006","last_updated":"2024-12-18T16:20:40Z","snapshot_observed_at":"2026-08-12T06:52:05.233715Z","submitted_at":"2024-12-18T16:20:40Z","title":"InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:37:59.529983Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2412.14006"},"observation_digest":"sha256:5bd74331929fd34707b4ce5a9e0c00e2f2c3820bc5b30a0b29ed5b5af2aafb57","observation_id":"c35744ab-b3ba-4957-b82b-3cb9040a231d","resolution":{"observed_at":"2026-08-11T12:37:59.529983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-10T21:31:15.951403Z","title":"Lisa: Reasoning seg- mentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.04670","last_updated":"2025-07-09T08:04:21Z","snapshot_observed_at":"2026-08-14T03:18:34.834807Z","submitted_at":"2025-01-08T18:30:53Z","title":"Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:31:15.951403Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2501.04670"},"observation_digest":"sha256:165a2d18482600f7be5030d7e900c8ca122699fe3f3226a4cadb3c16ce4ed0b8","observation_id":"ab6b5c80-ea47-4e38-ab44-fadae128fc91","resolution":{"observed_at":"2026-08-10T21:31:15.951403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-10T20:53:48.552690Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.06828","last_updated":"2025-03-13T08:16:01Z","snapshot_observed_at":"2026-08-13T16:56:56.343853Z","submitted_at":"2025-01-12T14:45:27Z","title":"GeoPix: Multi-Modal Large Language Model for Pixel-level Image Understanding in Remote Sensing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:48.552690Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2501.06828"},"observation_digest":"sha256:fdd105444df98486f206d5dec9f851c6b5a54d50bc72905b3bcc2486e7684c80","observation_id":"b1f5dab7-0915-4a14-8676-0d8951c142fe","resolution":{"observed_at":"2026-08-10T20:53:48.552690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-10T20:25:41.922273Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.08580","last_updated":"2025-01-15T05:00:03Z","snapshot_observed_at":"2026-08-14T05:45:14.827160Z","submitted_at":"2025-01-15T05:00:03Z","title":"Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:25:41.922273Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2501.08580"},"observation_digest":"sha256:3f62f5540b5c526057aadf031ed3e66ffab711979067c85f3cb9715e64b3492b","observation_id":"57551ff5-db4a-46ff-b974-7b06e4df53af","resolution":{"observed_at":"2026-08-10T20:25:41.922273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T21:32:35.621068Z","title":"International journal of computer vision, 123:32–73","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09447","last_updated":"2025-02-13T16:16:54Z","snapshot_observed_at":"2026-08-12T14:26:25.024187Z","submitted_at":"2025-02-13T16:16:54Z","title":"Pixel-Level Reasoning Segmentation via Multi-turn Conversations","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T21:32:35.621068Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2502.09447"},"observation_digest":"sha256:1668c338e2904468b04bbbddd06b3f1ba269212af1fa7ce2b6751a09387bb2e0","observation_id":"2ba89b2b-c607-46b3-9c58-1a1a3c8095b5","resolution":{"observed_at":"2026-08-07T21:32:35.621068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T20:25:58.469758Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09818","last_updated":"2025-02-13T23:29:01Z","snapshot_observed_at":"2026-08-12T07:59:26.923440Z","submitted_at":"2025-02-13T23:29:01Z","title":"On the robustness of multimodal language model towards distractions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:25:58.469758Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2502.09818"},"observation_digest":"sha256:00dd80c69533bf9935aef54adf8c81399bd68a000f15b5b052c0620864189523","observation_id":"69848a13-51bb-4a10-a771-a3e89c5162d9","resolution":{"observed_at":"2026-08-07T20:25:58.469758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T12:16:11.756541Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692 , 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-12T21:43:57.954411Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:11.756541Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:233c925ae321ee406b2c98bd225a8d073ffaf223c6baa07104d9e2adc1e07268","observation_id":"22f767ef-56a2-4155-a22e-5bbff6497ade","resolution":{"observed_at":"2026-08-07T12:16:11.756541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T11:41:45.382441Z","title":"LISA: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01738","last_updated":"2025-06-02T14:48:15Z","snapshot_observed_at":"2026-08-13T02:49:04.565682Z","submitted_at":"2025-06-02T14:48:15Z","title":"STORM: Benchmarking Visual Rating of MLLMs with a Comprehensive Ordinal Regression Dataset","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:41:45.382441Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.01738"},"observation_digest":"sha256:af48769b23f51889e2a05f5d9656e7c3ed3d31a4d5d52ae5c050e145f4d07535","observation_id":"11113140-16c8-4c23-abf7-a76ebf07b908","resolution":{"observed_at":"2026-08-07T11:41:45.382441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T10:27:27.498137Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05336","last_updated":"2025-07-05T11:38:26Z","snapshot_observed_at":"2026-08-10T11:30:31.815084Z","submitted_at":"2025-06-05T17:59:29Z","title":"VideoMolmo: Spatio-Temporal Grounding Meets Pointing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:27.498137Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.05336"},"observation_digest":"sha256:0b01c77222388246fe8610c09788f1c9e27951792b9049aa870bd9d0b982eea5","observation_id":"e6abe27b-963b-47ef-8e03-5daf892aa2b1","resolution":{"observed_at":"2026-08-07T10:27:27.498137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-07T04:29:18.093734Z","title":"arXiv:2308.00692 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10465","last_updated":"2025-06-12T08:13:38Z","snapshot_observed_at":"2026-08-12T14:25:40.899526Z","submitted_at":"2025-06-12T08:13:38Z","title":"MedSeg-R: Reasoning Segmentation in Medical Images with Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:29:18.093734Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2506.10465"},"observation_digest":"sha256:b23396ca12393d85c848783959fce445478d6657de87ca4d811e7b17b8b4d963","observation_id":"3e5e4640-7317-478a-b48b-99a5e8a3afb8","resolution":{"observed_at":"2026-08-07T04:29:18.093734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T18:48:41.170936Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.07317","last_updated":"2025-07-28T17:21:56Z","snapshot_observed_at":"2026-08-13T09:39:02.931949Z","submitted_at":"2025-07-09T22:29:47Z","title":"ADIEE: Automatic Dataset Creation and Scorer for Instruction-Guided Image Editing Evaluation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:48:41.170936Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.07317"},"observation_digest":"sha256:c261fbb4708c4cbc937645b380f38cf77dd5a736bde50b1b0a167485efa2f320","observation_id":"273f83b8-2f55-4422-b866-b56ff5e11ddb","resolution":{"observed_at":"2026-08-06T18:48:41.170936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T17:59:42.435568Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09612","last_updated":"2025-07-13T12:33:37Z","snapshot_observed_at":"2026-08-08T05:37:36.169460Z","submitted_at":"2025-07-13T12:33:37Z","title":"Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:42.435568Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.09612"},"observation_digest":"sha256:1860307fc939eb05f09be14f063a9e8e23c051b14da16d9afb33036c68def2c7","observation_id":"e1982561-f511-4d16-a33c-2e135b68235f","resolution":{"observed_at":"2026-08-06T17:59:42.435568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T17:22:09.963924Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11102","last_updated":"2025-07-15T08:52:28Z","snapshot_observed_at":"2026-08-14T06:13:06.826406Z","submitted_at":"2025-07-15T08:52:28Z","title":"KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:22:09.963924Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.11102"},"observation_digest":"sha256:c05e3ab181ac957eabc2032c440c199466c9530fab27e2f3befbc3a697d8efbc","observation_id":"096df928-9178-48e5-8a28-324a82b4db17","resolution":{"observed_at":"2026-08-06T17:22:09.963924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T16:33:56.916800Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13348","last_updated":"2025-07-17T17:59:55Z","snapshot_observed_at":"2026-08-13T05:47:55.095974Z","submitted_at":"2025-07-17T17:59:55Z","title":"VisionThink: Smart and Efficient Vision Language Model via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:33:56.916800Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.13348"},"observation_digest":"sha256:108b97580be03b273699527a5db76973cf52e8ab913e8c46ffa5469930788c2a","observation_id":"781612d5-9bc4-4af2-812d-dee76c2e90ef","resolution":{"observed_at":"2026-08-06T16:33:56.916800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T15:34:44.413798Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15569","last_updated":"2025-07-21T12:50:49Z","snapshot_observed_at":"2026-08-13T20:41:43.519119Z","submitted_at":"2025-07-21T12:50:49Z","title":"DynImg: Key Frames with Visual Prompts are Good Representation for Multi-Modal Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:34:44.413798Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.15569"},"observation_digest":"sha256:6473ea5fe2d27412a67c0104e9a576bdd843aa71964f2ec3481b103300dab949","observation_id":"78686686-890a-4340-87c9-c72b035b5a40","resolution":{"observed_at":"2026-08-06T15:34:44.413798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-06T15:25:03.031233Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16213","last_updated":"2025-07-22T04:09:14Z","snapshot_observed_at":"2026-08-14T02:36:01.994429Z","submitted_at":"2025-07-22T04:09:14Z","title":"Advancing Visual Large Language Model for Multi-granular Versatile Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:25:03.031233Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2507.16213"},"observation_digest":"sha256:f7cd837bb1ba5e43506c851b04bfdd4a3fc450e826fc30bdf77e65ebc4fad4f3","observation_id":"8230abef-3c1f-45fa-a6dd-28c842cf370b","resolution":{"observed_at":"2026-08-06T15:25:03.031233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-05T20:32:44.554728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:32:44.554728Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2508.10333"},"observation_digest":"sha256:8bebbd02d43fc79ebce50237adc332d844b21d90f49182174d63dec79c7585cd","observation_id":"9fca09ee-667d-40b0-9ce7-6108f3bd8d1f","resolution":{"observed_at":"2026-08-05T20:32:44.554728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2509.13484","last_updated":"2026-01-15T21:33:56Z","snapshot_observed_at":"2026-08-11T02:43:37.815329Z","submitted_at":"2025-09-16T19:31:40Z","title":"MINGLE: VLMs for Semantically Complex Region Detection in Urban Scenes","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T15:35:30.549656Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2509.13484"},"observation_digest":"sha256:4d74fadf0e1594c0123170e00826790c8d06c0d305a92d687c1a2c02736cef59","observation_id":"942099c8-ae51-4134-9c6f-d153f2cce095","resolution":{"observed_at":"2026-05-18T15:36:34.014108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-04T09:44:45.580737Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13808","last_updated":"2026-07-07T17:59:15Z","snapshot_observed_at":"2026-08-10T17:23:04.630042Z","submitted_at":"2025-10-15T17:59:52Z","title":"VisCoP: Visual Probing for Video Domain Adaptation of Vision Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:44:45.580737Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2510.13808"},"observation_digest":"sha256:86432235629dc0821104ff0478b607114d4a569082ed078124fc80b1d3ea3656","observation_id":"e27b91bd-f254-44cf-a1a9-9939fb1c3a6e","resolution":{"observed_at":"2026-08-04T09:44:45.580737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T04:21:29.526008Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2601.10611"},"observation_digest":"sha256:d15f46102249d8f51d7a4799e0eb091766dbc988ef8327ff9216d11a00717f12","observation_id":"67864beb-28a3-4eae-bb71-be687ea84ac1","resolution":{"observed_at":"2026-05-16T04:21:29.760001Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2603.27507","last_updated":"2026-04-26T20:14:44Z","snapshot_observed_at":"2026-08-10T23:52:35.908557Z","submitted_at":"2026-03-29T04:16:04Z","title":"Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:31:00.764078Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2603.27507"},"observation_digest":"sha256:f1693cd994fffb423c1a34e77455de29134902b095553b902359abd2c1a1501e","observation_id":"708a6f30-9b32-4808-ba10-c61796725e5d","resolution":{"observed_at":"2026-05-14T21:32:59.377974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2604.02593","last_updated":"2026-04-03T00:09:14Z","snapshot_observed_at":"2026-08-05T18:03:52.271482Z","submitted_at":"2026-04-03T00:09:14Z","title":"Moondream Segmentation: From Words to Masks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T20:14:45.629804Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2604.02593"},"observation_digest":"sha256:98a3e22736d38b9bb862fa37c1dc5692da9a16d3fb34b95b7f53985592d325e4","observation_id":"996455f2-3463-4e25-982e-58266447e76f","resolution":{"observed_at":"2026-05-13T20:18:13.708703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2604.08626","last_updated":"2026-04-17T22:49:55Z","snapshot_observed_at":"2026-07-06T22:57:40.773778Z","submitted_at":"2026-04-09T16:00:10Z","title":"WildDet3D: Scaling Promptable 3D Detection in the Wild","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:38:13.336003Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2604.08626"},"observation_digest":"sha256:f1e4abc0f523f00d3e15934c76299c9ae08fdfd012b647b9b0a1dd30ce4e6aa8","observation_id":"f26d572c-4106-4450-a5e5-e066623f7380","resolution":{"observed_at":"2026-05-11T06:26:00.672225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2605.19410","last_updated":"2026-05-19T06:04:23Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T06:04:23Z","title":"Vision Harnessing Agent for Open Ad-hoc Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:40.429412Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2605.19410"},"observation_digest":"sha256:ce13a98b11673513cc69f71b8b74fc30ae8b354e19e1fe604fbe05955ee67c7e","observation_id":"c053b920-dbe8-4a68-a714-ab6cf6b669dc","resolution":{"observed_at":"2026-05-20T05:53:04.407245Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2606.00592","last_updated":"2026-05-30T07:44:52Z","snapshot_observed_at":"2026-08-02T05:52:22.485746Z","submitted_at":"2026-05-30T07:44:52Z","title":"Through the PRISM: Principle-Aware, Interpretable, and Multi-Scale Evaluation of Visual Designs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T19:19:09.199731Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2606.00592"},"observation_digest":"sha256:14375e82b7faeace0b08b15524eaf27d57fd634f244d55b52d6c937e9e22f0d6","observation_id":"563f29a5-3d2d-4865-9859-216e933c1bf7","resolution":{"observed_at":"2026-06-28T19:22:34.444982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":"2308.00692","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-08T02:44:27.641390Z","title":"Lisa: Reasoning segmentation via large language model","venue":"cs.CV","work_id":"eaf09ef3-8136-41aa-a33e-5a1e1d8d612e","year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T02:44:00.608590Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:d99fad9081193f95c3d6f34e453fd9b23c7e4689095a40911f321f7edc45a4bd","observation_id":"f38ad578-1b2e-4d30-9651-b8bca572e351","resolution":{"observed_at":"2026-07-08T02:44:27.643086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-07-14T16:00:13.133298Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.06534","last_updated":"2026-07-13T03:52:19Z","snapshot_observed_at":"2026-07-16T23:18:47.677814Z","submitted_at":"2026-07-07T17:39:41Z","title":"CAIRN: Cross-Room 3D Scene Understanding with Topology-Aware Large Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T16:00:13.133298Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2607.06534"},"observation_digest":"sha256:910068ef6ed28b66f2c539fbc0ad579601ef8a6a3db65a00378dec6b9a094f0f","observation_id":"92a261bf-a0aa-4bd0-af57-212de3b6fb8d","resolution":{"observed_at":"2026-07-14T16:00:13.133298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-01T11:48:46.261946Z","title":"arXiv preprint arXiv:2308.00692 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19767","last_updated":"2026-07-22T05:27:30Z","snapshot_observed_at":"2026-08-08T13:50:09.534450Z","submitted_at":"2026-07-22T05:27:30Z","title":"Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T11:48:46.261946Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2607.19767"},"observation_digest":"sha256:1ccbc0c829017e4fbd780e94b90b495c2d0843959247e483e755f57b887867d5","observation_id":"4cdf2020-110e-4e22-9c09-901df2ceb4c8","resolution":{"observed_at":"2026-08-01T11:48:46.261946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.00692","snapshot_observed_at":"2026-08-12T00:50:38.830162Z","title":"Lisa: Reasoning segmentation via large language model.arXiv preprint arXiv:2308.00692, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07886","last_updated":"2026-08-08T03:26:38Z","snapshot_observed_at":"2026-08-13T23:21:50.267995Z","submitted_at":"2026-08-08T03:26:38Z","title":"Vision-Language Grounding as Bidirectional Concept Correspondence","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:50:38.830162Z"},"links":{"cited_paper":"/paper/2308.00692","citing_paper":"/paper/2608.07886"},"observation_digest":"sha256:f6199f20c1fe5376e4d267b4b0c33ef63ed394aa0ce8c5776147648e5de230b7","observation_id":"dcdd51bf-6c3a-4e16-a828-df52d40381e8","resolution":{"observed_at":"2026-08-12T00:50:38.830162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.00692/citation-record","integrity":"/paper/2308.00692/integrity","json":"/paper/2308.00692/citation-record.json","paper":"/paper/2308.00692"},"outbound":[],"paper":{"arxiv_id":"2308.00692","last_updated":"2024-05-01T05:10:13Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:43:01.434381Z","submitted_at":"2023-08-01T17:50:17Z","title":"LISA: Reasoning Segmentation via Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2308.00692."}