{"as_of":"2026-08-05T14:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fa07827aeb38670b5d36ea90269b2dd1ded013573ae500ce1ff49e8cb88c13e3","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:40:16.265708Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00987/citation-record","integrity":"/paper/2606.00987/integrity","json":"/paper/2606.00987/citation-record.json","paper":"/paper/2606.00987"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:3e64496f18b03d7e84d3bac6f89bc70182a8eca445f1b094e4cbe1a259c30394","observation_id":"a88b726d-ff30-4912-ba73-140fb83f7d80","resolution":{"observed_at":"2026-07-01T20:46:14.164447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:a100c2e141f9f1c0db2e5a0560e7e595ad42c32e845411da8c9f7990439037c7","observation_id":"a6198e52-cdc5-447d-ae4c-9857bcd0e90a","resolution":{"observed_at":"2026-07-01T20:46:14.213949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:a0207a71753d2997e25d2b628c44486b22eb896ad791f9dac9bc95b96b3bda39","observation_id":"e0e549da-0763-4e7c-88b5-adefa676b1a5","resolution":{"observed_at":"2026-07-01T20:46:14.183927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"F- lmm: Grounding frozen large multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:8a7a40b90f4173de810f5829fc54f009cf2971917da30a83e37834509dec1b85","observation_id":"386e7487-fbca-4357-9a91-1f5c7d6fdabd","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T20:46:14.214773Z","title":"arXiv preprint arXiv:2510.18262 (2025) SOUBench 19","venue":null,"work_id":"30353152-a3fd-4fe2-8285-217fa6b5df14","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:79cbc883adace935124ff812337d5b4cee4b4b8760f97e47f37b42c3a8d53031","observation_id":"faacc1f0-c7ba-4061-bbc9-27be9e0ca036","resolution":{"observed_at":"2026-07-01T20:46:14.216373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:81cf45b21d6c2aeac774dd94d0d786a2eec4e908366513ddc334bc022124e1e0","observation_id":"99f573e4-a6f1-4736-b71b-5bfa43119794","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Remotesam: Towards segment anything for earth observation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:27b9453b6ff4b3149d764da5b49025d5370ff42e8d01291fe850a9eb30f87405","observation_id":"3d28aca3-9ec8-46d3-bdd9-71b9796fd0f0","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Videoglamm: A large multimodal model for pixel-level visual grounding in videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:ae8c5020078527dfa92817c08252cb26a166cd469118d97ee6128855cfe3705c","observation_id":"756d752b-a23e-4021-b726-bdd33912de47","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:2e6202fc4ae09a51a96a919d48a5678e215a85dcedb086ddcf3fd8966b615f70","observation_id":"5a416c7d-2231-4f5a-9b7c-d584ae41fc0a","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Ai flow: Perspectives, scenarios, and approaches,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:49eeac347253f3ab55c382612e45d6f2e1f243dc8ffbec3ceb8fa1a7c0ef27ab","observation_id":"7243a222-074b-4b85-896e-2e09d155ba10","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:56:34.484834Z","title":"Stare-vla: Progressive stage-aware reinforcement for fine- tuning vision-language-action models","venue":null,"work_id":"3c7f4a51-b740-42de-aa84-54cf42eda9ab","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:f06307fcdf2a8c88d3eda14277e6c70f5dda55be73f30b6917bc74e86b9ffe22","observation_id":"a5333b60-ef10-4b2a-83c6-54081fa536f4","resolution":{"observed_at":"2026-07-01T20:46:14.198611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.21656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:39:24.027350Z","title":"Fine-grained preference optimiza- tion improves spatial reasoning in vlms","venue":null,"work_id":"a37905fb-348b-4d6f-95af-750374d9e775","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:89b43ce8fae0e858a4d11ae9a5003b791816bc6ab45c119cfc3952e2e361f43a","observation_id":"2af199be-5159-4e5c-bdc1-8309168697e9","resolution":{"observed_at":"2026-07-01T20:46:14.190814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.410440Z","title":"Toward cognitive supersensing in multimodal large language model.arXiv preprint arXiv:2602.01541","venue":null,"work_id":"7311d972-667b-4ae2-b9eb-1fc3c4d9ef84","year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:965ab02e7f67d3b51b59366db1cdbd745a27ea81b6f11e778ba85c2ad165b2e6","observation_id":"ee6344e3-c40b-4c3e-80bd-00d037102112","resolution":{"observed_at":"2026-07-01T20:46:14.213597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.20169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.447143Z","title":"Egoforge: Goal-directed egocen- tric world simulator","venue":null,"work_id":"95730a14-3dca-4ada-825b-80bb50608dc7","year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:dea6638c66b2661930860e5f854c225de1295e867ad40e55e7892eafa657297c","observation_id":"db18d797-4cfe-481c-a9c4-41f324f48041","resolution":{"observed_at":"2026-07-01T20:46:14.200625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.10523","doi":"10.48550/arxiv.2508.10523","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sarkar, M","venue":"arXiv (Cornell University)","work_id":"e83196f0-3beb-41c8-a25f-3d933fc53312","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d98a5d2b8e1e1b38624078da5ada1793b5be8b87734901748f737e0bfc2fa2ad","observation_id":"87d26cf6-af90-4253-b73c-3139d9a37f39","resolution":{"observed_at":"2026-07-01T20:46:14.193321Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21812","last_updated":"2025-06-26T23:25:22Z","snapshot_observed_at":"2026-07-06T21:48:21.795039Z","submitted_at":"2025-06-26T23:25:22Z","title":"Towards Transparent AI: A Survey on Explainable Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.21812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21812","snapshot_observed_at":"2026-07-02T22:37:25.774350Z","title":"https://arxiv.org/html/2506.21812?utm_source=chatgpt.com","venue":null,"work_id":"fa3dbdf3-17cd-4b89-968f-7e56385ead3c","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2506.21812","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:bf224a2509322bb2c6aba1e60b12c67a1ea7d7e6513c425e580f0cbb51ca57cb","observation_id":"733fa65d-e51f-4006-abce-e1b0b86615e9","resolution":{"observed_at":"2026-07-01T20:46:14.205785Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Yielding unblemished aesthetics through a unified network for visual imperfections removal in generated images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d7224bfe035e181d5a7f64a57960c926b0374663005e9d5b5d1acb19d967d5cd","observation_id":"3b36b617-7fb5-4586-9d14-a35eea7e5c46","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Cotextor: Training- free modular multilingual text editing via layered disentanglement and depth-aware fusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:f43478d49429e613a161306835a8d2a562f650bde9dab0a0d8c5321fac085acc","observation_id":"4f686098-1e85-41e2-ac72-ccae06458cce","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Forgetme: Benchmarking the selective forgetting capabilities of generative models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:77d9f31d166287f72d8b2b1643216a4a48232bac8e6befc36d1b26712352616a","observation_id":"27f99180-5f71-4e60-a204-f8c62b53e71c","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Tri- subspaces disentanglement for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:523b5932337e709a62427c8f11770c8a1d156ad32d3560de66f102e4c2001cb9","observation_id":"2f410424-bc24-46c9-8a69-d5cac1812941","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Generative video compression: towards 0.01% compression rate for video transmission,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:c896d16a589312c5977a8ebc83dd5100f8ca85412de908e069716f82b0df57d0","observation_id":"ff76da4f-f106-456e-a4d9-fbfd514d06e0","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Geobench-vlm: Benchmarking vision-language models for geospatial tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:a87e1f84005b447363497158c46bc24657de43b97b04b231b90d19bab76991d0","observation_id":"9e859310-7427-42a8-aead-a46f796b3f4c","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Geomag: A vision-language model for pixel-level fine-grained remote sensing image parsing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:94b74c7fa10125d8a355d402c55167075e27e5acb2a687f78e62346f0c302e15","observation_id":"12034758-bd3b-4643-9cfc-4f15709b750e","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13925","last_updated":"2025-01-23T18:59:30Z","snapshot_observed_at":"2026-07-31T01:05:18.406030Z","submitted_at":"2025-01-23T18:59:30Z","title":"GeoPixel: Pixel Grounding Large Multimodal Model in Remote Sensing","version":1},"cited_work":{"arxiv_id":"2501.13925","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13925","snapshot_observed_at":"2026-07-03T13:48:20.421796Z","title":"Geopixel: Pixel grounding large multimodal model in remote sensing","venue":null,"work_id":"3296b24b-31dc-4d02-ac22-dc0bf0209a20","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2501.13925","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:ff6b8db4aed449a8c7d48e48c93938024626ea4f975e59ca50d8e2ce292caa51","observation_id":"d0c7bef5-3ad5-44d7-882b-941a180e2791","resolution":{"observed_at":"2026-07-01T20:46:14.192236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Dinov3-powered multi- task foundation model for quantitative remote sensing estimation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:e9f5ca8e71e8c9210285e476f7aadea9f8285c274fb7f424622ce0bd4e2083b9","observation_id":"44c2dc00-cb64-4c8e-afd7-9aa40009251c","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Visualizing our changing earth: A creative ai framework for democratizing environmental storytelling through satellite imagery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:30fd39948af5bb993c694da9f7ecf7ea380fd9ce43f575b1bbc7afdff33ab415","observation_id":"c980e607-7c2d-43a0-ad46-e386644e0d33","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Spatiotemporal alignment for remote sensing image recovery via terrain-aware diffusion,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:8b533bce3b5f963bb6423b0a55dead9b60e31e0e649d077479e7fc005dfba790","observation_id":"d68a5817-e438-40a4-9c49-4b75c11f5653","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:06.520659Z","title":"Maris: Marine open-vocabulary in- stance segmentation with geometric enhancement and se- mantic alignment","venue":null,"work_id":"ea4e7b75-ce66-499e-a4b1-8893efd9e048","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:74bd87273cbd8c9f5779bc7effd65465925bc5971f5bb30a2bf9cd66cc3d0e9f","observation_id":"31fd2b20-15aa-4204-ac7d-8909cd1e52bf","resolution":{"observed_at":"2026-07-01T20:46:14.187062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Convolutions die hard: Open-vocabulary segmentation with single frozen convolutional clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:61f1b385e6912c49c34025bf4ce373e153c312eaf9f32778ccceaee210fba94b","observation_id":"157da8f6-092d-4ba4-ac1a-e0fd77cc935e","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Diffusion models for open-vocabulary segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:042cca349672f7ba1ea7b8591f79213e74db47f023662574eb884d2e7ff511c1","observation_id":"e4b94894-d8e1-4b26-aa62-514cc51a1646","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Cat- seg: Cost aggregation for open-vocabulary semantic segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:b641be3efc319c0613d49c259f5491097d063f6d297bbe09defe6f599f32b476","observation_id":"4d4a4dae-74b4-4978-be14-178c0f84f9f8","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:06.510214Z","title":"Exploring the underwater world segmentation without extra training","venue":null,"work_id":"fa64a5da-0a71-49e9-9a49-a22ba0b1a00e","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:f1cbfbca08123c09e6a5d0347672b407b4d60a06a7c417fb804f141b181eb1fd","observation_id":"4a2349cc-104a-435e-96d8-f2f76257c0ca","resolution":{"observed_at":"2026-07-01T20:46:14.189718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T23:59:06.534469Z","title":"Exploring efficient open-vocabulary segmentation in the remote sensing","venue":null,"work_id":"fa137f13-333c-49db-be54-b970eff78b9a","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:341124740830d1b75400a78e7d0bf044f90ce340051966ff5701906c4004b789","observation_id":"f5aecb79-6bb3-4d65-88f4-4050e988a015","resolution":{"observed_at":"2026-07-01T20:46:14.203116Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"A simple framework for open-vocabulary segmentation and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:0c772342e2e946d34265a8f1cb06623e21d3ad032e980e2e6fb112cdc9344d8e","observation_id":"eb032346-130f-4d10-a3b3-52fa6bb19821","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08984","last_updated":"2023-06-08T06:35:33Z","snapshot_observed_at":"2026-07-06T13:43:13.386359Z","submitted_at":"2022-08-18T17:55:37Z","title":"Open-Vocabulary Universal Image Segmentation with MaskCLIP","version":2},"cited_work":{"arxiv_id":"2208.08984","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08984","snapshot_observed_at":"2026-07-03T08:57:47.583278Z","title":"Open- vocabulary universal image segmentation with MaskCLIP","venue":null,"work_id":"afa10fbf-e01c-48af-9b6b-e884ef223fc6","year":2022},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2208.08984","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:e2ae972db4492d58b6ac47547a73226fc44ebfe751d0825bb3995110a7500108","observation_id":"e37f32d6-6377-4bc8-885d-19ed37c1634d","resolution":{"observed_at":"2026-07-01T20:46:14.181598Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Polyformer: Referring image segmentation as sequential polygon generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:8081cd1c52fe2a6252665adfbfb1ca5ac8a231e3011bfc37e59aceff92862c75","observation_id":"8bd25363-6166-44e0-9148-42d1f80acebf","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Toward robust referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:97c10927981093941040c2e8a9e4ed9fb828bd88e24db605faaf885a03b1a12e","observation_id":"b7e684e8-876c-42c3-bba0-1d740faa619a","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Rotated multi-scale interaction network for referring remote sensing image seg- mentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:ff3361fe7950acc1ec5b34f5547e05b175f2d94c8ca83bdb6ff6ff3d0c657979","observation_id":"93f4eb1b-1afd-496d-87af-8e0460bc41aa","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Lqmformer: Language-aware query mask transformer for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:1cc2c9e58856dddb4880ef15e12711b3ff96539e654efaee91fc84825a981847","observation_id":"107e43cd-717f-435f-a019-79aa9b790423","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"A survey of language-guided video object segmentation: from referring to reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:ba4b16f5366c4968d9b71f89233ca8054a290ad03323276e75f81b913f7d2048","observation_id":"726183f7-5b03-4209-adab-5bfa650b28e0","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Adaptive selection based referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:a31014be7c6c5b21711a009eb8b599800372526025c3fb6fa66f43a98f6756bd","observation_id":"3fd8ddec-fc60-4b95-850c-fd982ffd5b2f","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Rsrefseg: Refer- ring remote sensing image segmentation with foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:25d413b6a7cbe21b21e757978ed9f680a33b82ced3633ce555f934f91191954f","observation_id":"8c9ba2e8-83c3-48c3-956f-db1c22483370","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.01331","last_updated":"2025-08-02T11:57:56Z","snapshot_observed_at":"2026-08-02T02:49:51.343561Z","submitted_at":"2025-08-02T11:57:56Z","title":"Referring Remote Sensing Image Segmentation with Cross-view Semantics Interaction Network","version":1},"cited_work":{"arxiv_id":"2508.01331","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.01331","snapshot_observed_at":"2026-07-01T20:46:14.206859Z","title":"Referring remote sensing image segmentation with cross-view semantics interaction network,","venue":null,"work_id":"bd8a8407-0813-4715-b930-81f0a06cbf34","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2508.01331","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d760ee48886fae54695e18e100c8e2086dd141890bcaadba172c255b0531af15","observation_id":"0b8480fb-a4df-4ba9-8a30-95ebb747e862","resolution":{"observed_at":"2026-07-01T20:46:14.208362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Deris: Decoupling perception and cognition for enhanced referring image segmentation through loopback synergy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:2282d0d58e90657b2bb43dae34a7a3096b68e2ff9bd3de7db889fb07c19bb2fe","observation_id":"b30691bb-55c7-4280-aaeb-08f06d8cbdba","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Lavt: Language-aware vision transformer for referring image segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:6ef0eacf973187dd1c4d7a767640c3bca8d3b37ba04ce412380dcf71af0469ba","observation_id":"7af768d3-d5e3-47e5-a58f-47ec0412fa35","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Gres: Generalized referring expression segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d2bc199de6947272e45c98366c4f8d6e162f47feea0c2baf0295fcfbdc8f6e17","observation_id":"041aaf67-9059-433b-80b4-35e9c57ea6fd","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Mask grounding for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:b6d7f62c845fc43127822bb906f703e53d4eadb82dad3b1d1ae22cbb861377ee","observation_id":"b8e467a4-0021-4335-85bb-9504af4634de","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18923","last_updated":"2024-10-31T19:44:05Z","snapshot_observed_at":"2026-08-02T13:34:32.666990Z","submitted_at":"2024-10-24T17:11:52Z","title":"SegLLM: Multi-round Reasoning Segmentation","version":2},"cited_work":{"arxiv_id":"2410.18923","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.18923","snapshot_observed_at":"2026-07-04T15:09:55.052787Z","title":"SegLLM: Multi-round reasoning segmentation","venue":null,"work_id":"7f6d8b5a-0303-4868-9747-3eafadf37484","year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2410.18923","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:0cc974add2f607f571b4dea1dbafb5ee3a9983dfd3861421cc7743f4d71f7bd7","observation_id":"75a8a89c-a09f-45b6-9850-41ad423f7087","resolution":{"observed_at":"2026-07-01T20:46:14.182343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18816","last_updated":"2025-05-24T18:23:14Z","snapshot_observed_at":"2026-08-04T02:24:13.870531Z","submitted_at":"2025-05-24T18:23:14Z","title":"Reasoning Segmentation for Images and Videos: A Survey","version":1},"cited_work":{"arxiv_id":"2505.18816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18816","snapshot_observed_at":"2026-07-04T15:09:55.361578Z","title":"Reasoning segmentation for images and videos: A survey,","venue":null,"work_id":"0447ba5c-64a6-4019-9adf-5c1fb1c58f6f","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2505.18816","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d0e82634358637c51041fd3cc9bdab2beff4b249c53d0e9298da29449707abf3","observation_id":"99dbdaa5-f54f-43cb-989b-8cf35a603dd1","resolution":{"observed_at":"2026-07-01T20:46:14.156308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06520","last_updated":"2026-05-31T09:29:40Z","snapshot_observed_at":"2026-08-05T01:42:30.194131Z","submitted_at":"2025-03-09T08:48:51Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","version":3},"cited_work":{"arxiv_id":"2503.06520","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06520","snapshot_observed_at":"2026-07-04T19:30:08.050016Z","title":"Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement","venue":"cs.CV","work_id":"7a33b2a4-8409-4a00-ad7b-84e810df1ba7","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2503.06520","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:ae9041a8cb8402bed0865d24ad186aa63149e21a6783b7e534a69f2b2f4e3458","observation_id":"6262dea8-79f3-4bf1-ad9e-5b2c0a861604","resolution":{"observed_at":"2026-07-01T20:46:14.161959Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":"2312.17240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-07-08T02:04:26.295057Z","title":"An improved baseline for reasoning segmentation with large language model","venue":"cs.CV","work_id":"65f7318c-50ed-477a-9f4c-ed321aa0df93","year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:cd21ae51b03b1a4ff7d6ffb26e3569a37ab490312e78b54e187b93873131ac93","observation_id":"24910f6d-07cf-422e-b5f3-ece4397050b8","resolution":{"observed_at":"2026-07-01T20:46:14.171607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Dataset on underwater change detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:3d4e91458b535b0ff0171b633da461bb0e07dd86740804965cc853fcc18a3ccd","observation_id":"fc042287-b249-459e-b042-f1df4dbba405","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Mds- net: An image-text enhanced multimodal dual-branch siamese network for remote sensing change detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:4235e7f60e3c6e1df9f2b45e10354e2f73ca267d270e26c62e80c977168639df","observation_id":"269e7fc8-94f7-460f-9f88-e2302d504874","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Qrs-trs: Style transfer-based image-to-image translation for carbon stock estimation in quantitative remote sensing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:612bc0ccc73394e16ae7d70db3cd3b95f153a02fd9bd2f4ca2ba6cd16a353066","observation_id":"68c8aed3-ad50-451d-98a3-0465981abfa8","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12931","last_updated":"2025-01-22T15:02:43Z","snapshot_observed_at":"2026-07-06T20:24:27.525217Z","submitted_at":"2025-01-22T15:02:43Z","title":"DynamicEarth: How Far are We from Open-Vocabulary Change Detection?","version":1},"cited_work":{"arxiv_id":"2501.12931","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.12931","snapshot_observed_at":"2026-07-01T20:46:14.177075Z","title":"Dynamicearth: How far are we from open-vocabulary change detection?","venue":null,"work_id":"f39f8cff-cf84-4bdb-8c61-f835c4f93d82","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2501.12931","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:778b288ea10d40ac5a1599b6a887e6edec524bdc1446d59b150224219dd6c3fa","observation_id":"34876e45-82f6-410b-b6d1-0bcf5f017603","resolution":{"observed_at":"2026-07-01T20:46:14.178562Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Semantic-cd: Remote sensing image semantic change detection towards open-vocabulary setting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:7bc7f77946b62901bfc9310eb5ae88210ef2be7e61b03cd769e322a911ec2b8b","observation_id":"d68b17bd-4409-4c9c-9ad9-f32b7acc8bca","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.02607","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:09:29.653655Z","title":"Unichange: Unifying change detection with multimodal large language model.arXiv preprint arXiv:2511.02607","venue":null,"work_id":"e67ecf8e-3114-43f1-870f-7249f06741e6","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:2b31989c57e60019dc1e75137a929db44610f420403c6010e361516b24a7eef9","observation_id":"39a0002f-7a89-4372-912d-8ca6077f836a","resolution":{"observed_at":"2026-07-01T20:46:14.201063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Referring change detection in remote sensing imagery,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:2396c5fd968a2796c04186a9dffdbae45889c521519807d2cb2c57d9515cd395","observation_id":"f5c814ed-b30b-4a55-a3c4-3b38419a37c1","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Changechat: An interactive model for remote sensing change analysis via multimodal instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:7c0a04ec1a01a02c57d7f7784f837d8ca6c401453ead2f14df17f6ffcd29817b","observation_id":"b3ad838a-468b-4437-92f2-caaf20dca015","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17944","last_updated":"2025-06-27T13:30:09Z","snapshot_observed_at":"2026-07-06T21:45:52.378309Z","submitted_at":"2025-06-22T08:40:56Z","title":"SegChange-R1: LLM-Augmented Remote Sensing Change Detection","version":2},"cited_work":{"arxiv_id":"2506.17944","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17944","snapshot_observed_at":"2026-07-02T14:37:03.034693Z","title":"arXiv:2506.17944 (2025)","venue":null,"work_id":"f3808215-3513-4b14-9f82-62374cc3d98c","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2506.17944","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:36c64753ae71fbc5779abf366d82d101ae68e4d18ff6b17cf94967caffc70d7e","observation_id":"897820a2-7a06-4b6f-8922-8448c0d59f36","resolution":{"observed_at":"2026-07-01T20:46:14.197919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08585","last_updated":"2023-09-15T17:41:29Z","snapshot_observed_at":"2026-07-06T16:19:05.495349Z","submitted_at":"2023-09-15T17:41:29Z","title":"Viewpoint Integration and Registration with Vision Language Foundation Model for Image Change Understanding","version":1},"cited_work":{"arxiv_id":"2309.08585","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.08585","snapshot_observed_at":"2026-07-01T20:46:14.210138Z","title":"Viewpoint integration and registration with vision language foundation model for image change understanding,","venue":null,"work_id":"4a6eb1cf-3eda-4d1e-87e0-420df92032ab","year":2023},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2309.08585","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:baa705fd53889c700b8bcb7977010bc34373f29ec75982fd1882932421596e43","observation_id":"a69347af-56bc-455a-8495-89411de767a3","resolution":{"observed_at":"2026-07-01T20:46:14.211728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Modeling context in referring expressions,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:419171f319c1045dc20955408f81d56f21db24cb8d24aa1fc9135d2a8a131d0f","observation_id":"1d90989a-9fc2-4e25-b726-7d0f8bf3b2d3","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Rrsis: Referring remote sensing image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:d6f1684659aaffc800a3e4ae1c0756cc13d2b2d943e05d431eeef3c4e5ec55f3","observation_id":"7bd51686-e612-4e48-ae59-82ea51cad6a4","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:2239a4e393c7102eb505ea045d6b0f1a36fdd4eecd1872dfd2b42b9671f8b68a","observation_id":"4711ecdb-aac1-480f-a009-c5ca83a235e9","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:bef3b65dfc6f469d3485919ac3d5db5a53b44abbf92ceca8e4850ce74d118ed6","observation_id":"5e3cb0ed-e35f-4d7e-9830-7cff9c11df97","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Cris: Clip- driven referring image segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:9a7f880dde864596f8d2eaf6afc30867119d259b6c73ae6cf191d99f82746e07","observation_id":"a160db88-cbfd-452e-a1da-8329ba0f9338","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Exploring fine-grained image-text alignment for referring remote sensing image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:1bedd67ef780eac9c2c554cc40cf9f5593234d83d322d4428d5bb6d5113c5d2d","observation_id":"18864c7c-39c8-4b6e-b83f-de7d2d8f9786","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:40:16.265708Z","title":"Gsva: Generalized segmentation via multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:90948df1876e4ad8f009f7c73633a1b5086199db9daf1dfe0a45199bad28d98f","observation_id":"f7425539-de8e-411e-a3a7-b720087cdaf2","resolution":{"observed_at":"2026-06-28T17:40:16.265708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.23332","last_updated":"2026-05-11T14:21:31Z","snapshot_observed_at":"2026-07-06T22:37:12.421372Z","submitted_at":"2025-11-28T16:40:08Z","title":"UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes","version":3},"cited_work":{"arxiv_id":"2511.23332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.23332","snapshot_observed_at":"2026-07-03T05:27:40.018151Z","title":"UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes","venue":"cs.CV","work_id":"b951a0a4-4aa1-4345-b39b-7d503d14230a","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2511.23332","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:7b957ca458e51e10f116ec3bd456f42d2b5db5e02bf50a2676275a13e7062ac6","observation_id":"00e97dd3-bf1d-42ef-bc06-20a269f2d50b","resolution":{"observed_at":"2026-07-01T20:46:14.210868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09644","last_updated":"2025-04-13T16:36:47Z","snapshot_observed_at":"2026-08-01T18:21:09.547388Z","submitted_at":"2025-04-13T16:36:47Z","title":"SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model","version":1},"cited_work":{"arxiv_id":"2504.09644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09644","snapshot_observed_at":"2026-07-03T05:27:39.970148Z","title":"SegEarth-R1: Geospatial Pixel Reasoning via Large Language Model","venue":null,"work_id":"8708b235-bdfb-4e1b-bc29-c47d6ba39624","year":2025},"citing_paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T17:40:16.265708Z"},"links":{"cited_paper":"/paper/2504.09644","citing_paper":"/paper/2606.00987"},"observation_digest":"sha256:053e0db5aa7b5a270f0a36c202672e62e92256e397153d2b7fea2c94b412b4cc","observation_id":"a9297750-c2d6-4705-ab34-a7e7eaea5a07","resolution":{"observed_at":"2026-07-01T20:46:14.218945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.00987","last_updated":"2026-05-31T04:01:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:01:10Z","title":"An Open-Source Benchmark and Baseline for Multi-temporal Referring Segmentation"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":44,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2606.00987."}