{"as_of":"2026-08-16T04:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d47039e1351f6605ca978e26ed52ba6cb83a729616ee9a13db60e0fee4a344af","coverage":[{"denominator":95,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":95,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:22:12.020753Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:00:20.216268Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:11:04.772242Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"cited_work":{"arxiv_id":"2509.06321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06321","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text4seg++: Advancing image segmentation via generative language modeling","venue":null,"work_id":"f5d55ffa-a85b-4f6a-a92e-e4155b4d77c1","year":2025},"citing_paper":{"arxiv_id":"2604.07765","last_updated":"2026-04-12T05:49:10Z","snapshot_observed_at":"2026-08-14T11:13:27.928398Z","submitted_at":"2026-04-09T03:40:46Z","title":"RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:20.216268Z"},"links":{"cited_paper":"/paper/2509.06321","citing_paper":"/paper/2604.07765"},"observation_digest":"sha256:697d16e05ad624e80aac26ed71ca5fcee73515776d6f6b90871790a69cbac70f","observation_id":"76f9a169-93e0-42b8-a8fe-e1941f75b22b","resolution":{"observed_at":"2026-05-11T05:40:59.696291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"cited_work":{"arxiv_id":"2509.06321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06321","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text4seg++: Advancing image segmentation via generative language modeling","venue":null,"work_id":"f5d55ffa-a85b-4f6a-a92e-e4155b4d77c1","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2509.06321","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:b705e4d099d20226a2b676396c45a634911e69292db7b92179d546f47cffba49","observation_id":"68a75981-2033-4edd-8651-8fe608d4a57d","resolution":{"observed_at":"2026-05-11T10:11:04.784266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06321/citation-record","integrity":"/paper/2509.06321/integrity","json":"/paper/2509.06321/citation-record.json","paper":"/paper/2509.06321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.644442Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.644442Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:8ee4398223a6b3fb2fa5ead51551a3d185ffb74980906283439ff5cb3726a2d9","observation_id":"716f03b8-86ab-4e08-8c8d-74761c3720c9","resolution":{"observed_at":"2026-08-15T16:22:11.644442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.649338Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.649338Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:b938c912ab9d2d8ee5e30cd7ce5649cfa740fa4ff6c38f96e1a92a96e64afc1e","observation_id":"0f62a146-a2f4-4d63-9bc6-f5571e8f2534","resolution":{"observed_at":"2026-08-15T16:22:11.649338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.653667Z","title":"Deepseek- vl: Towards real-world vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.653667Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5074766d12095c552b0f422e1d0bc3891b6dd06254bd7183c5cd83aad03371b7","observation_id":"8dc1dd1d-1d75-4478-99a3-d81a985a0b0c","resolution":{"observed_at":"2026-08-15T16:22:11.653667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.657945Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.657945Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:80e4e48c8eb3c2a5a3b64b6db078971ebca28bdd6377265affca5e173558da8a","observation_id":"b1d28aa1-1afb-47d4-89ab-1b0f6dd3b58c","resolution":{"observed_at":"2026-08-15T16:22:11.657945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T16:22:11.662006Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.662006Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c82bdacc3b164d345396ce69438229ed013d5800365500fb29d69c76c9f48feb","observation_id":"4d2d77bb-cbc9-4ddb-b413-26d7105d731f","resolution":{"observed_at":"2026-08-15T16:22:11.662006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.666105Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.666105Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:543f802b129194318bccb1c123515fd61b8d78d098483c01401e38ce386c97d1","observation_id":"5a9bf968-02f8-4a54-bb14-9d970c2c971a","resolution":{"observed_at":"2026-08-15T16:22:11.666105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.670520Z","title":"Moma: Multimodal llm adapter for fast personalized image generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.670520Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:4dca6e7469903a54545c3ed2909e7d8e0ee01407936db3a956ef39f8c718b35a","observation_id":"caee47b3-16b0-426b-83da-88d573f67b5c","resolution":{"observed_at":"2026-08-15T16:22:11.670520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.674849Z","title":"Genartist: Multimodal llm as an agent for unified image generation and editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.674849Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c9d3b2fb80b5b0df6017695545bd4a308619e902d2420ad3d80d83d3ce59853b","observation_id":"e6fbfd26-846e-440f-b710-2f666d48e2b6","resolution":{"observed_at":"2026-08-15T16:22:11.674849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.678251Z","title":"Visionllm: Large language model is also an open-ended decoder for vision-centric tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.678251Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:6a6ba397a8d66470c8ba1e17a369c0739cf324579890d11db8d952938a36f057","observation_id":"f1d1bcbb-da5a-485d-80d1-2c248c5cca09","resolution":{"observed_at":"2026-08-15T16:22:11.678251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.682149Z","title":"Groma: Localized visual tokenization for grounding multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.682149Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:ad9abda39251fe857b729adc60c700c1fb615265f0858490c38ba282170e6f25","observation_id":"b331bf85-980c-48c2-9934-994d1a0e9ce7","resolution":{"observed_at":"2026-08-15T16:22:11.682149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.686481Z","title":"Towards open vocabulary learning: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.686481Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:9df8a64f57f6002321ac23a61c6d9cb0fd4807f5fbb50cd89fe2f5195cfa8ffe","observation_id":"94569e89-143d-482b-b03f-8cb59540ccbe","resolution":{"observed_at":"2026-08-15T16:22:11.686481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04498","last_updated":"2023-12-18T12:15:26Z","snapshot_observed_at":"2026-08-13T05:30:05.715696Z","submitted_at":"2023-11-08T07:15:05Z","title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04498","snapshot_observed_at":"2026-08-15T16:22:11.690392Z","title":"Next- chat: An lmm for chat, detection and segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.690392Z"},"links":{"cited_paper":"/paper/2311.04498","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:dfc2f81c77738c182af23b721869b0d9998fd98864506c2327aeedd3bc982de8","observation_id":"8b45ef7e-c52e-4f57-bdae-c0cd4a2de9df","resolution":{"observed_at":"2026-08-15T16:22:11.690392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.694066Z","title":"Transformer-based visual segmentation: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.694066Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:1b828f4d366450e6d5826290d82fcf8678a18e4d93b5bb881156803124d67e66","observation_id":"c90b2773-5ec2-4b61-b6bc-3826548b16ba","resolution":{"observed_at":"2026-08-15T16:22:11.694066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.698288Z","title":"Smooseg: smoothness prior for unsupervised semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.698288Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:208b13cbdb49c9315dfa4d774f0f7bbc63ac9ecd09d45a83cb5d9955756a8b52","observation_id":"4cae6a04-e525-4a39-8aec-5334820936e0","resolution":{"observed_at":"2026-08-15T16:22:11.698288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.701900Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.701900Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c03c66895b4cdae1833bca41a139eb7fde1f5ba153e3c918f711b89a928f8682","observation_id":"4c81b0c7-3da7-41b1-a837-d777d9576340","resolution":{"observed_at":"2026-08-15T16:22:11.701900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.705717Z","title":"Gsva: Generalized segmentation via multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.705717Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:a5aa650251fee2098a9553db15dbea0dfd3cdb490c2b9332871498bc5703bea3","observation_id":"39fbcf90-08c0-4bca-a33e-f78a08036d04","resolution":{"observed_at":"2026-08-15T16:22:11.705717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.709253Z","title":"Groundhog: Grounding large language models to holistic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.709253Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:171a11d3b7f59908818743a3a5c5377f7c11bfc38cd20e22f669c6360ed7f5b3","observation_id":"53d79d32-df32-4514-b455-bf21be807aa1","resolution":{"observed_at":"2026-08-15T16:22:11.709253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:13.087241Z","title":"Multi-modal instruction tuned llms with fine-grained visual perception,","venue":null,"work_id":"69bf8513-3a01-45b7-ad1b-a627b2b7095e","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.712961Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:94bf7e0f4a3a5fb392eb18f900a2bc86bd4f30ed921516b5b27dde4f7c0574af","observation_id":"d4bfe972-1a09-4597-adb3-ad423ed28433","resolution":{"observed_at":"2026-08-15T16:22:13.092047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.716782Z","title":"Pixellm: Pixel reasoning with large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.716782Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:95e7bf7ac854d80220d3143b32a68eeb3888e47962129d519cd789234791cd96","observation_id":"c682b7c6-6b0b-431b-b2b6-d712e43d3a44","resolution":{"observed_at":"2026-08-15T16:22:11.716782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.720335Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.720335Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:ba19d77503e459b16c747e993585dbdc8b6c30b3c12b5c516f2de984ee6853c7","observation_id":"8d824f5d-66f3-4eb5-920f-0e1ba053b51e","resolution":{"observed_at":"2026-08-15T16:22:11.720335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:13.057963Z","title":"Segment anything,","venue":null,"work_id":"c3b1feed-27d6-4141-96b0-98d448e39e5a","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.723550Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:0ebcdb08b113f659e59f54ebaab5d4aa62a72779db6b91ae1468ffcc0ce178e5","observation_id":"4b0231c8-78cc-47bb-bd3a-4d8fb6362b3f","resolution":{"observed_at":"2026-08-15T16:22:13.061678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:13.045904Z","title":"Jack of all tasks master of many: Designing general-purpose coarse-to-fine vision-language model,","venue":null,"work_id":"64f4118b-c3c2-41bc-b03f-8eb1efe58b9b","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.727281Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5ce86be26fc864d15599f3bc9e82ac97073b3eac8d654b6d5aa32f0a62ea0b65","observation_id":"2757456d-95a0-4a9d-8364-b9ccd471cf09","resolution":{"observed_at":"2026-08-15T16:22:13.049975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.730552Z","title":"Florence-2: Advancing a unified representation for a variety of vision tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.730552Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:d8f2839ef2727862c339e4400e7d5c799a53da9f77ec6e1e0307cef42cdca13e","observation_id":"8ce7c468-7c2d-4911-b0df-892351472ea5","resolution":{"observed_at":"2026-08-15T16:22:11.730552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:13.024877Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks,","venue":null,"work_id":"d52cd91c-051a-4bb9-93f3-a6c37f705adb","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.734262Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:cd6f122dfdfb7d2c2f9d234152e124794b3efd9ee4db293a9b2b85d5d1fb73e4","observation_id":"5f83132b-68e7-42eb-a17b-282989b0cc3d","resolution":{"observed_at":"2026-08-15T16:22:13.028829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:13.012547Z","title":"Text4seg: Reimagining image segmentation as text generation,","venue":null,"work_id":"bd74034d-8691-43b9-8598-a39086476056","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.737875Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:28f47b393fcf9d97e3e96d69d582ac9280de000a2041ffb098ec24d4348467e8","observation_id":"2c00a354-3c52-442e-95d3-202f7297586f","resolution":{"observed_at":"2026-08-15T16:22:13.016913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.741490Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.741490Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:3b00f6f01f591ecbf87c189c8830ff97acd091860e6ba61eb6a56a16b400563d","observation_id":"3340fec4-8112-4d05-b5d3-b798fd76bfaf","resolution":{"observed_at":"2026-08-15T16:22:11.741490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T16:22:11.745868Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.745868Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:cbf2ecfdc9a2e3483c61e7586fb0efcc12fb0cc76b95b919998b29500e67cff9","observation_id":"89d2949c-35d2-43a8-b989-53a6f514d1df","resolution":{"observed_at":"2026-08-15T16:22:11.745868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-15T16:22:11.749956Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.749956Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:7b79dd5bbe88bc3ca6c6da4ee5d35d9ef773b791d4b10b1fe79a764f61d352a5","observation_id":"a42fe197-fe8a-4913-9466-e31f781d7447","resolution":{"observed_at":"2026-08-15T16:22:11.749956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T16:22:11.754625Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.754625Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:793feafb75232a3fcf4cef3f68d4d45fd063e080dc42f07ce24c4b4f9f1060c2","observation_id":"82cff4a6-f430-488c-b07e-fa39a01ab7d9","resolution":{"observed_at":"2026-08-15T16:22:11.754625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.763615Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.763615Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:3f5b41c4880f5a60e41bb5df9a75c70679e5dfeb45a2adccf01116748e8a3d5e","observation_id":"edecca24-37f4-4c2e-9ca0-c4797a88165d","resolution":{"observed_at":"2026-08-15T16:22:11.763615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-15T16:22:11.768709Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.768709Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:56938c956654834622b5b832d7e5ff0ff3bb0c92bd255097bd2350fb9d3274a2","observation_id":"21d16457-5f00-4542-a3f3-967ad991e07b","resolution":{"observed_at":"2026-08-15T16:22:11.768709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.772986Z","title":"Otter: A multi-modal model with in-context instruction tun- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.772986Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:2b6fe9cad85c66c1efee18cbd438378c6697efb69f0bf7a7d5fb7b2139b02bea","observation_id":"446592e4-4679-473f-b55a-3ee3f890c9fb","resolution":{"observed_at":"2026-08-15T16:22:11.772986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.777847Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.777847Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:3baca4f57740afbc3cae4b6fe9cad3dd7af8cb77799d42702241fda960050c67","observation_id":"b276f24d-9047-4ef1-8600-15cbdc992481","resolution":{"observed_at":"2026-08-15T16:22:11.777847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.968312Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":"a26fc721-d7d4-4cf6-a2f3-5e0ee56a5c7e","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.781394Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:203ed135bc8bdd356fc0d434068493c9bd43d00b55864ab2b7dde33f550da9bd","observation_id":"128d0749-aefc-4acd-ab02-6d2d38d36b82","resolution":{"observed_at":"2026-08-15T16:22:12.972530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.785177Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.785177Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:3ec66ab4a830b33691b9a983d6b5a1cb03d4ed9d15c416e8f26db6c04a71f1cd","observation_id":"dc0a4841-5d66-46b6-b9dd-a889b2aad7f5","resolution":{"observed_at":"2026-08-15T16:22:11.785177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.789970Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.789970Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5affc07ebcafda720ff0e1cd48444a93920d10adde7bf470aad1e31d33b94b52","observation_id":"05423cf7-ef37-4460-866a-4b857ceccefc","resolution":{"observed_at":"2026-08-15T16:22:11.789970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.931996Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images,","venue":null,"work_id":"2d8de3d9-68fd-4466-bdd2-2f244894aed6","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.793527Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:4c011f06f9c3f3369da1d4aecdc0010e3a80f7e59bba3bc748934b5378309bb7","observation_id":"e7ebdc94-4c9d-4f1e-aaac-b5d4b732a407","resolution":{"observed_at":"2026-08-15T16:22:12.936360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.797042Z","title":"LLaV A-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.797042Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:0c811f82666206b85cb6f68349f9bd24756cb2d1604a00d71cf49b6d64a15a19","observation_id":"3bd5248c-a49a-44c3-b423-d01028ee0af6","resolution":{"observed_at":"2026-08-15T16:22:11.797042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-15T16:22:11.801178Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.801178Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:dcfe98e3ee31cc6d418180fcb3a1fc055fb432682f520d02979c4c1639c6931b","observation_id":"0524b036-e703-4ede-8226-be2ca8ba1850","resolution":{"observed_at":"2026-08-15T16:22:11.801178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.911499Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models,","venue":null,"work_id":"fdcb3b62-a9f1-47f3-82d5-52bf8be142e5","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.805233Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:89b91e02497a955da3fbe5efff0801deac826b0297de9776dbf410fadb5bffc9","observation_id":"f96255a2-8309-447a-b909-56648d063aca","resolution":{"observed_at":"2026-08-15T16:22:12.914788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.899071Z","title":"Sphinx: A mixer of weights, visual embeddings and image scales for multi-modal large language models,","venue":null,"work_id":"da5b1d7d-4509-4739-84aa-1e30bbd2da98","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.808587Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:7615d9a0d8570914568a414eee742f8868af89d7e9fda338bc7d72e0977c73d3","observation_id":"b9539a27-86bc-45bb-b126-6a766f17464a","resolution":{"observed_at":"2026-08-15T16:22:12.903353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14006","last_updated":"2024-12-18T16:20:40Z","snapshot_observed_at":"2026-08-15T07:01:26.380594Z","submitted_at":"2024-12-18T16:20:40Z","title":"InstructSeg: Unifying Instructed Visual Segmentation with Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14006","snapshot_observed_at":"2026-08-15T16:22:11.811999Z","title":"Instructseg: Unifying instructed visual segmentation with multi-modal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.811999Z"},"links":{"cited_paper":"/paper/2412.14006","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:05b07aa6ae83534986b87477eb55ddfb6f8317bf31ed25f4942c3c4fca8d6aa2","observation_id":"f5fd926b-d934-461f-92c3-477900688a3a","resolution":{"observed_at":"2026-08-15T16:22:11.811999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T16:22:11.816944Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.816944Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:2c5e43be5fe393af2dc28c780a86e1d66d5205ff71438fe753a7e17bf0bffed1","observation_id":"45383fa1-5c15-439e-8906-6ef399568545","resolution":{"observed_at":"2026-08-15T16:22:11.816944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T16:22:11.821043Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.821043Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:6e89165ea339ddc7db42169d66e05204ab9ac08e33a61b81879a0f1409673848","observation_id":"c6acb05d-fd47-4252-bbd5-d27fcc0f1210","resolution":{"observed_at":"2026-08-15T16:22:11.821043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.885910Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding,","venue":null,"work_id":"3ab2761c-0c1b-49df-8c4d-a1ec07f78d1e","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.824965Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:9bbe93196b51053da2507bda42396c3116d15f9ce7fcc44ecfa4fcccc395a3eb","observation_id":"dc969136-352c-41b6-b41a-a505387dc42b","resolution":{"observed_at":"2026-08-15T16:22:12.889964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.873438Z","title":"MMR: A large-scale benchmark dataset for multi-target and multi-granularity reasoning segmentation,","venue":null,"work_id":"0068165a-0591-497a-bcd8-a6c35b590a50","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.828896Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c65f32d22b9029297b64b0fb72b3fd0a4ce1873cccfbfd6bdddf515cff32aadd","observation_id":"506b73e9-c295-4ebe-a4b0-bb695d08020b","resolution":{"observed_at":"2026-08-15T16:22:12.877817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.861209Z","title":"SegLLM: Multi-round reasoning segmentation with large language models,","venue":null,"work_id":"808c6d6c-27e6-4d66-9538-cf15d8825788","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.832846Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:d775f7d75c8fd1b3a3185600d42e042a7e371f4c7bfe8bf2a933f70789626fe5","observation_id":"a4d57b4b-8fd7-4272-8936-30d94812745c","resolution":{"observed_at":"2026-08-15T16:22:12.865219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09644","last_updated":"2025-04-13T16:36:47Z","snapshot_observed_at":"2026-08-07T16:06:07.544996Z","submitted_at":"2025-04-13T16:36:47Z","title":"SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09644","snapshot_observed_at":"2026-08-15T16:22:11.836256Z","title":"Segearth-r1: Geospatial pixel reasoning via large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.836256Z"},"links":{"cited_paper":"/paper/2504.09644","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:157f6b6f9ebdbc1830a607d9b3decc00b921a3acb79d65aa04b2bdbdd642caa7","observation_id":"9e40fef4-cb57-4c04-9145-434de89ae1fb","resolution":{"observed_at":"2026-08-15T16:22:11.836256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.849271Z","title":"Geopix: A multimodal large language model for pixel-level image understanding in remote sensing,","venue":null,"work_id":"5b00d9a3-25c0-489a-b040-31cb827806e7","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.840953Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:de3e30e9eb40adaed2cf6a68be486383a26745025889ad69738e2388269c6b5d","observation_id":"2d391006-c002-41de-887e-13e3b3027ba3","resolution":{"observed_at":"2026-08-15T16:22:12.853105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.844728Z","title":"Ufo: A unified approach to fine-grained visual perception via open-ended language interface,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.844728Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:0eb8ef7743c4bf4cb746ae7802a349c77c54c5266928141075c4decd8fa5c47f","observation_id":"b1685c66-070a-4431-85ea-9f62e4d035c8","resolution":{"observed_at":"2026-08-15T16:22:11.844728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10465","last_updated":"2025-04-14T17:52:22Z","snapshot_observed_at":"2026-08-15T01:58:55.434124Z","submitted_at":"2025-04-14T17:52:22Z","title":"Pixel-SAIL: Single Transformer For Pixel-Grounded Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10465","snapshot_observed_at":"2026-08-15T16:22:11.849167Z","title":"Pixel-sail: Single transformer for pixel-grounded understand- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.849167Z"},"links":{"cited_paper":"/paper/2504.10465","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:8802fcdefe7b110981130fade79857e4eb20cef0512ad22f467ab7dc0175a843","observation_id":"a11488e5-ef7a-44eb-8211-4e66ff77f7f4","resolution":{"observed_at":"2026-08-15T16:22:11.849167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13026","last_updated":"2025-07-16T06:31:29Z","snapshot_observed_at":"2026-08-13T08:46:37.292956Z","submitted_at":"2025-03-17T10:29:08Z","title":"HiMTok: Learning Hierarchical Mask Tokens for Image Segmentation with Large Multimodal Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13026","snapshot_observed_at":"2026-08-15T16:22:11.853172Z","title":"Himtok: Learning hierarchical mask tokens for image segmentation with large multimodal model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.853172Z"},"links":{"cited_paper":"/paper/2503.13026","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:e5565cf7c9ca9c049ea6a0d8c2755b45624c4cd34316d0d057f3cea2abb240e1","observation_id":"84c93dfc-4775-4d2c-845e-0d00910c8ed7","resolution":{"observed_at":"2026-08-15T16:22:11.853172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.857799Z","title":"Alto: Adaptive-length tokenizer for autoregressive mask generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.857799Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:44691bbf076b413de0e077e248fd29bf709b2cb22ca1d5fdecb627daef3f1dcb","observation_id":"c98a7b17-c7fc-43fc-a776-a22a0b3c0603","resolution":{"observed_at":"2026-08-15T16:22:11.857799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.835962Z","title":"Pix2seq: A language modeling framework for object detection,","venue":null,"work_id":"8d292a8f-b5f7-4d82-a1f7-cdf28e13148b","year":2022},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.862017Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:bc55d3d993c02a82cc1c16c7d960dc9f7c17782305ca467fc26eed79b6b5de4a","observation_id":"d15d53f2-8816-4c93-b271-92667ee7490e","resolution":{"observed_at":"2026-08-15T16:22:12.839915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.865970Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.865970Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:d7468460e3579395b7c4e75cb4a65a82cb8ace2e88c8f13782dd20bc367186ae","observation_id":"fe671d6a-c133-46d4-b53b-5648672120c8","resolution":{"observed_at":"2026-08-15T16:22:11.865970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.814096Z","title":"Universal instance perception as object discovery and retrieval,","venue":null,"work_id":"5f5253df-fb35-4f01-9239-4b8455986fdc","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.869533Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:a954c2ce9c12b32a564632ba6d9409ffde439ccfe83c148e14356ada6fd6fa64","observation_id":"306794c4-6ea0-41ed-8e0e-06b6f31e3e57","resolution":{"observed_at":"2026-08-15T16:22:12.818231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.799048Z","title":"Grounding multimodal large language models to the world,","venue":null,"work_id":"efbea9d7-815e-4159-b232-513872c21f3a","year":null},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.873438Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5c751ecffc0b739adb2576dc0a9012960702a3f10818bb53e0693fc5eb2ac065","observation_id":"0d5e6583-3433-414d-bfc1-87373ee463fe","resolution":{"observed_at":"2026-08-15T16:22:12.803605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-15T16:22:11.882102Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.882102Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:38bf91e3bfef116fbc215fa52cfd66dd1dcc0dc1876ea1432e0b401ddf1e8ee2","observation_id":"320582a0-6bac-4264-a043-f1fcc1cac410","resolution":{"observed_at":"2026-08-15T16:22:11.882102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.772435Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, edit- ing,","venue":null,"work_id":"35f571a2-e7a2-4ab5-a23c-d0e6d7c1678c","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.886029Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5cfa9a9d487e47e23c69a561f0ae10fba0db15f18da43bf74d6f076d19c35a61","observation_id":"e05b92de-6617-498c-99a7-d8d3fe58a783","resolution":{"observed_at":"2026-08-15T16:22:12.777035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.889729Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.889729Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:7590da62b4d1c1e7a2a147563c2bd23c5fa15f8cbd349c18121d76eb051687e3","observation_id":"4b781d89-4d0c-4727-89d3-7ea2c2337776","resolution":{"observed_at":"2026-08-15T16:22:11.889729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.893149Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.893149Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c93d579adb2fbb4ee5847bbc350c3d7d1602c38cb47109965b63cd967a7a9081","observation_id":"230337c0-0811-4a7f-8cf2-040084193265","resolution":{"observed_at":"2026-08-15T16:22:11.893149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T16:22:11.896690Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.896690Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:9e1d4986fff4139c2f5c88f162212060ea4bc8b12062509919abf5578096062a","observation_id":"0bfcbda7-bbfb-401c-9a30-7e642fb9b842","resolution":{"observed_at":"2026-08-15T16:22:11.896690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T16:22:11.900181Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.900181Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:16d667431438dd3e768e45e879500395b0f391de91c63b0b6083ddc387094619","observation_id":"84748385-428c-4c6c-a591-2c664d0d6fd0","resolution":{"observed_at":"2026-08-15T16:22:11.900181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.904054Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.904054Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:bf3e04a8865e72231d9a103948f38a27b60522d3cb0763c372778a4870bbc9a7","observation_id":"52b70454-8e07-4d83-b61c-ef088c3260e4","resolution":{"observed_at":"2026-08-15T16:22:11.904054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.732055Z","title":"Run-length encodings (corresp.),","venue":null,"work_id":"5ef9681f-61c2-4978-8dd8-b46735c1b998","year":1966},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.907469Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:4549c9ec5d9268d587fc30732baf0418d4df7a503a4e16cbd9b2ef2f036a7c8d","observation_id":"ef7d8813-6477-4dd3-88cf-18cd7bda100c","resolution":{"observed_at":"2026-08-15T16:22:12.736085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.911086Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.911086Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:87162a271594fdf9ce60d19504209d98cdba76e61c008acce5167cf9e65ff52b","observation_id":"f785469b-2cee-4162-ad49-b1de33aa02b5","resolution":{"observed_at":"2026-08-15T16:22:11.911086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.710166Z","title":"SAMRefiner: Taming segment anything model for universal mask refinement,","venue":null,"work_id":"7f96a4cc-35ff-4199-a8fc-db069f05296f","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.915243Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:a30846a27a1e55cb2bd02f5f9713b3a42250c5f88ebbc61316a4e353ef269eb0","observation_id":"f5456534-717c-4bc7-bc20-d58eaba8d97c","resolution":{"observed_at":"2026-08-15T16:22:12.714414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.918817Z","title":"Swift: A scalable lightweight infrastructure for fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.918817Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:35aee1341e7ff443ba2eaadd7bf1194dbd13e6acf9163743af5a8094b07e8c02","observation_id":"f3d74f23-94dc-4fbe-b79d-835510d30056","resolution":{"observed_at":"2026-08-15T16:22:11.918817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.922230Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.922230Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:e8166840925e74a4c5ff593b9cfb03b9cf73ea932e31964e6683e7b760f378e6","observation_id":"64db9197-ac38-4595-b229-491b711ab833","resolution":{"observed_at":"2026-08-15T16:22:11.922230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.925703Z","title":"Zero: Memory optimizations toward training trillion parameter models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.925703Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:b34087cbf08f94d8f0c28efc069e155e5ce8bf35f293a05c3ba54c7df0e1423e","observation_id":"d8d3f090-35ac-47ac-baae-11165d5b497a","resolution":{"observed_at":"2026-08-15T16:22:11.925703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.682270Z","title":"Phrasecut: Language- based image segmentation in the wild,","venue":null,"work_id":"6eef40db-6776-4a60-98f5-d184199bd8ba","year":2020},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.929150Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:830af68cfa1db6691d349389d1a607c4e092a7dc2193387da0f1026af97a17c5","observation_id":"8c2f4997-aefa-4d50-9056-382aceb3729f","resolution":{"observed_at":"2026-08-15T16:22:12.686003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.933479Z","title":"Gres: Generalized referring expression segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.933479Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:18652c40475f6a5ae0a756b3ea3752266508b66f281fb711d4d7ae582d3d7e9e","observation_id":"e0ae129a-3705-4b2c-9108-52d019562233","resolution":{"observed_at":"2026-08-15T16:22:11.933479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.660192Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":"8350c06f-ed9f-4941-b02a-0efbdf7510e7","year":2016},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.937004Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5311e147e70f3311dcea5ce504ffa42f472f60cfc776299c6bae2c69c3022189","observation_id":"3686281b-e532-4e50-ac3c-a56d9b657180","resolution":{"observed_at":"2026-08-15T16:22:12.664754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.645307Z","title":"Polyformer: Referring image segmentation as sequential polygon generation,","venue":null,"work_id":"e62880cc-d335-44b7-b016-e94c06d9c360","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.940648Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:bb6d87604fe0502859b102aac76eccf0e7decdd271bc744b65573649c331dd04","observation_id":"60c9acc2-87f3-4fc6-8bff-7b8dca37a979","resolution":{"observed_at":"2026-08-15T16:22:12.649362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.632507Z","title":"Language-aware vision transformer for referring segmentation,","venue":null,"work_id":"dd4190f0-e1ef-4228-b386-0a612b082265","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.945194Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:a01d538d772ba521b8b4a1556be95c37c38874b4d38a570852ebe4c2b60a9707","observation_id":"4247aed3-20bc-4b26-8943-9cf3d65b7d7e","resolution":{"observed_at":"2026-08-15T16:22:12.636010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.620647Z","title":"Sam4mllm: Enhance multi-modal large language model for referring expression segmentation,","venue":null,"work_id":"f1a9eede-e49c-45d4-a3f0-3e2030b21e8a","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.949061Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:5fc7187fb2b9845b1d92b464c8ed2e9f20cedd5142460d585e1dad77d1b4be21","observation_id":"234ead33-0ceb-4629-a3c0-72245f0cad71","resolution":{"observed_at":"2026-08-15T16:22:12.624866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.608101Z","title":"Segagent: Exploring pixel understanding capabilities in mllms by imitating human annotator trajectories,","venue":null,"work_id":"3f0f33f1-cc5d-4e4b-a766-7adaaabd1296","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.952590Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:10e89d997f0cc0b3b8224013f70c87615a74d36f9c6e69a69807ba7398d66202","observation_id":"2c238a44-1cd0-4a52-8fb2-93a1ec3b2511","resolution":{"observed_at":"2026-08-15T16:22:12.612245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.596500Z","title":"Popen: Preference-based optimization and ensemble for lvlm-based reasoning segmentation,","venue":null,"work_id":"e01bbf96-f8aa-4b53-afba-d6f6b68d2f11","year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.955957Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:dddcc9ca960c30eaaefdda99e82df9de694a28368a775fcce577ea3b0872eb5c","observation_id":"6a763a57-4dd6-4ce9-84ff-dea2c2b65cc7","resolution":{"observed_at":"2026-08-15T16:22:12.600552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.959710Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.959710Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:9f64e4da982da8b2b57a06fc4bc65d7b11fca246f4ea4f35572b89d10392e4a6","observation_id":"bef2a781-708f-493b-870f-7e3811d59447","resolution":{"observed_at":"2026-08-15T16:22:11.959710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13893","last_updated":"2025-01-23T18:08:57Z","snapshot_observed_at":"2026-08-13T23:14:19.264762Z","submitted_at":"2025-01-23T18:08:57Z","title":"Pix2Cap-COCO: Advancing Visual Comprehension via Pixel-Level Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13893","snapshot_observed_at":"2026-08-15T16:22:11.963065Z","title":"Pix2cap-coco: Ad- vancing visual comprehension via pixel-level captioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.963065Z"},"links":{"cited_paper":"/paper/2501.13893","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:6ddf568cd31e80a46fbe98e561801dc261c7cb7f6a97b67ad4f6226f62c42821","observation_id":"d3a068ef-ac45-4ca4-8037-8a2be6265799","resolution":{"observed_at":"2026-08-15T16:22:11.963065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.967009Z","title":"Rotated multi-scale interaction network for referring remote sensing image seg- mentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.967009Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:d133ba897692cfd03ae47775e26f097f75c1737227750ffcb2f9fd208e05d26c","observation_id":"8b1d6538-e8bc-4143-8f47-7199505655a3","resolution":{"observed_at":"2026-08-15T16:22:11.967009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-07T17:19:13.101842Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-08-15T16:22:11.970567Z","title":"Seg- zero: Reasoning-chain guided segmentation via cognitive reinforce- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.970567Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:3bb7e24ed8ab7a1152e5be563a7f7053daf0299c5b8ca7af1ca61c8d9974f911","observation_id":"17537b21-d030-4ca4-aeea-3d170b5374cb","resolution":{"observed_at":"2026-08-15T16:22:11.970567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.568048Z","title":"Clearclip: Decomposing clip representations for dense vision-language inference,","venue":null,"work_id":"a1ac093b-2905-426b-ad0d-551a7539bd9e","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.974102Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:911cfd07bd7c9711236c7556093d1cf7b975af6e8bbb7ff6fd7996b3656d99b3","observation_id":"0d2acdad-31d8-414b-8f75-d6c98ce3ada1","resolution":{"observed_at":"2026-08-15T16:22:12.571985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.555393Z","title":"Proxyclip: Proxy attention improves clip for open-vocabulary segmentation,","venue":null,"work_id":"f7ea7d25-ed7d-4150-ac67-a68d33ddddf5","year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.977841Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:bdef47fbf714fb7ff3ea6f7fc4d3dbc56b34dacbfd5af62220711fdc9cf74eb0","observation_id":"df2477ff-adf3-4639-ae1c-b2ed00f958c9","resolution":{"observed_at":"2026-08-15T16:22:12.559234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.541659Z","title":"Open-vocabulary universal image seg- mentation with maskclip,","venue":null,"work_id":"b16ca3b7-7637-4071-a5c1-3d0dc0091347","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.981115Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:2169c3bfbb82597eca43112a1105e1211a7605148b36c2370097601d8e28ad61","observation_id":"9b5a401e-d20c-4b66-90d3-87f9f5ec3a74","resolution":{"observed_at":"2026-08-15T16:22:12.546367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:11.985304Z","title":"Groupvit: Semantic segmentation emerges from text supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.985304Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:dd1c57dded4c48781e17adf2273c9a632fd755b51723c4e926a850ca77f5a74f","observation_id":"978982d6-d188-4c57-8389-88d97b2b0a29","resolution":{"observed_at":"2026-08-15T16:22:11.985304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.522827Z","title":"Open-vocabulary semantic segmentation with mask-adapted clip,","venue":null,"work_id":"a7a45e0f-e3fd-4061-ab38-fb620fccde81","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.990287Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:b1a2b660843f1beae3a2ddc9ec545d5653d3446593ff4043bb8d1b5284ee9a31","observation_id":"66daabaf-eb5a-4188-8002-d8627b4eda68","resolution":{"observed_at":"2026-08-15T16:22:12.526750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.509741Z","title":"San: side adapter network for open-vocabulary semantic segmentation,","venue":null,"work_id":"bacacd07-9016-4b10-8f58-5aa178889c8d","year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.994740Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:f93a4cf5e2581c4573c185d6b63f58dd05e716eabf9c1b9322c5e71e25d538ed","observation_id":"ed057f24-fdde-4764-90b4-5af354059273","resolution":{"observed_at":"2026-08-15T16:22:12.513496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08506","last_updated":"2024-04-12T14:40:45Z","snapshot_observed_at":"2026-08-13T00:31:54.264749Z","submitted_at":"2024-04-12T14:40:45Z","title":"LaSagnA: Language-based Segmentation Assistant for Complex Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08506","snapshot_observed_at":"2026-08-15T16:22:11.998453Z","title":"Lasagna: Language- based segmentation assistant for complex queries,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.998453Z"},"links":{"cited_paper":"/paper/2404.08506","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:e91752bf9c10a074d2fcfd10076db1402b52236ca17d8b744b2cd7bbf1e595ac","observation_id":"1865d8d8-7f24-4bf2-bcee-fc1d0f0a6a95","resolution":{"observed_at":"2026-08-15T16:22:11.998453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11904","last_updated":"2025-05-10T15:43:29Z","snapshot_observed_at":"2026-08-14T08:28:09.837202Z","submitted_at":"2024-11-16T05:12:11Z","title":"GeoGround: A Unified Large Vision-Language Model for Remote Sensing Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11904","snapshot_observed_at":"2026-08-15T16:22:12.003667Z","title":"Geoground: A unified large vision-language model. for remote sensing visual grounding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:12.003667Z"},"links":{"cited_paper":"/paper/2411.11904","citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:f58655b746f7d254672b88bd15669e08245da6145dbd51bccd609f584794dbcd","observation_id":"087076ab-fc36-4a0d-8bcb-19179f2882ed","resolution":{"observed_at":"2026-08-15T16:22:12.003667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.008111Z","title":"Semantic understanding of scenes through the ade20k dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:12.008111Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:044fcb98d9010791618fb0d1c61d375bf5eb9227c6ad68d3d1c724d4ee447870","observation_id":"7cc02e5b-4d07-447e-b3c4-5230c55aa13b","resolution":{"observed_at":"2026-08-15T16:22:12.008111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.012802Z","title":"The role of context for object detection and semantic segmentation in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:12.012802Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:2cc184ff800bd07febec9aa1f4ac9bc2ebd25b13bdcf7547f04d750d417784cc","observation_id":"a824abb5-81a9-416a-8517-7eccd65fa637","resolution":{"observed_at":"2026-08-15T16:22:12.012802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.479638Z","title":"The pascal visual object classes challenge 2007,","venue":null,"work_id":"8fd80e17-f2d8-4f07-b16e-913fecb0a2d2","year":2007},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:12.016591Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:ea17185879337bbb71375698b40ec7813c8cae10585bb9469adde71b5efd58ce","observation_id":"9d36d4c7-c8c8-4889-bc75-68c29c1516b4","resolution":{"observed_at":"2026-08-15T16:22:12.485552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.020753Z","title":"Side adapter network for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:12.020753Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:10ad41880b63b86e38fe4153811364e8ba9c8f9273c51645438cf8875e33fdec","observation_id":"01d8ea53-ab5f-4988-bb0a-26d37fc44b82","resolution":{"observed_at":"2026-08-15T16:22:12.020753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:22:12.786575Z","title":"Available: https://openreview.net/forum?id=lLmqxkfSIw","venue":null,"work_id":"7bc06ef4-9e51-42e6-8451-b000410fca9c","year":null},"citing_paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:22:11.877495Z"},"links":{"citing_paper":"/paper/2509.06321"},"observation_digest":"sha256:c067ccd8b86a157a79f7cc51d7a0979f010ad5c88767b0126190db9bbba61858","observation_id":"7ece75ed-0efc-4d9b-82aa-09cc53b2e085","resolution":{"observed_at":"2026-08-15T16:22:12.790745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06321","last_updated":"2025-09-08T04:07:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T20:09:51.031073Z","submitted_at":"2025-09-08T04:07:14Z","title":"Text4Seg++: Advancing Image Segmentation via Generative Language Modeling"},"reference_resolution":{"displayed":95,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":95},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 95 of 95 outbound references and 2 inbound Pith citation observations for arXiv:2509.06321."}