{"as_of":"2026-08-07T17:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70e200d62de353646505b13932cdc87e62713cbd5d7a14e4679ec949a9c61fa2","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:53:04.127385Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:13:52.383043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23120","snapshot_observed_at":"2026-08-03T22:13:52.383043Z","title":"Enhanc- ing spatial reasoning in multimodal large language mod- els through reasoning-based segmentation.arXiv preprint arXiv:2506.23120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.383043Z"},"links":{"cited_paper":"/paper/2506.23120","citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:ab5e80b154415d045e37ef9f6329f55ea55c91cf0d75ad2c4ec48ceed787881b","observation_id":"ba066641-729c-4b3d-b6c6-854f6ebf7940","resolution":{"observed_at":"2026-08-03T22:13:52.383043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23120/citation-record","integrity":"/paper/2506.23120/integrity","json":"/paper/2506.23120/citation-record.json","paper":"/paper/2506.23120"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:57.793154Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.793154Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:bdf5946628f998b86cef8d49aa1f2e08bd87d0bab4bcd1f61bdaf8677c00eca5","observation_id":"325774cd-e2b0-4437-9db1-1771425d731c","resolution":{"observed_at":"2026-08-06T21:52:57.793154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.658767Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1d878cd8-63cb-4256-93ec-2e48ab160344","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.848548Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b25dfbfa9093f531f9261f0652057c4beff28751c2ce9660df410d268b3fb8ad","observation_id":"6a7764da-d893-49aa-80d6-879fc4821c98","resolution":{"observed_at":"2026-08-06T21:53:14.729965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.515123Z","title":"Semantic scene com- pletion via integrating instances and scene in-the-loop","venue":null,"work_id":"ae8bebed-c527-4739-a21b-70bcad87fcac","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:57.941641Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:5dc6ecc900f3be78848edfdff29e76cd4caf7693953135b030f3c37e2911781c","observation_id":"ec84b564-9542-4b2a-b53d-af68d50282d6","resolution":{"observed_at":"2026-08-06T21:53:14.576806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.326033Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"9d8eed12-76da-496d-8daf-cb51b728c812","year":2020},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.068312Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:554778a1df7f17b02df0cd6ce4a30a578c1725916cd15516ec205928611e7678","observation_id":"eb38820f-994a-4424-a259-5980f3e22e0d","resolution":{"observed_at":"2026-08-06T21:53:14.406809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.160844Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"e8a16532-7a22-4530-a8bb-593eeeae65a8","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.206308Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:336ce9ff92e8c0dee83bd218fe046612a9a078026508aa53c1fb394c70f8f630","observation_id":"7525dbd6-533c-4a95-babf-e4d55a965115","resolution":{"observed_at":"2026-08-06T21:53:14.238738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:14.001542Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understand- ing reasoning and planning","venue":null,"work_id":"4038835e-3f5d-46af-bf17-625dc49b6723","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.293363Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:32a2d32daaa931d2987f01ac76ee00ff11139ed5b0ad91ef858ba5185b41ae88","observation_id":"5b1a3463-d775-4faf-b2e6-b2f6a048ebe2","resolution":{"observed_at":"2026-08-06T21:53:14.061588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.784930Z","title":"Mppnet: Multi-frame feature intertwining with proxy points for 3d temporal ob- ject detection","venue":null,"work_id":"307c0380-7baa-4906-8dc2-1a065b7552e6","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.381758Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7f8ba37d2f2e1f8c261661d5023caea5be516ca95bb1ded0ee4d66a015a774fa","observation_id":"becd4c34-3a8b-4b1e-9027-ac8dbaaa3d1b","resolution":{"observed_at":"2026-08-06T21:53:13.902145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.610821Z","title":"Trajectoryformer: 3d object tracking transformer with predictive trajectory hypotheses","venue":null,"work_id":"dfbb30c0-1606-4c0b-9baa-40ba55949a84","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.480676Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8a2625c25b025628072befba5cc3426cae8429213e42545902a756e9560e2463","observation_id":"fd2f6363-7d1b-458d-a749-37362235b4e2","resolution":{"observed_at":"2026-08-06T21:53:13.687509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-06T21:52:58.607061Z","title":"Grounded 3d-llm with referent tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.607061Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c48fa623af40194c8d28a408647f2de2a4903ad94d79678a5135c9a689465245","observation_id":"1c299235-7d13-492f-b05f-0ee47acad1ef","resolution":{"observed_at":"2026-08-06T21:52:58.607061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.452079Z","title":"Reslt: Residual learning for long-tailed recog- nition","venue":null,"work_id":"c17ea751-fe1f-4359-aff7-e939daa0cf6a","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.701391Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:638444ece8dba7e8a81f04289f5addac85f83a7beae6b26bee27489dbf49147a","observation_id":"a1c83751-31cb-426a-ac9f-b69ab4ad7c73","resolution":{"observed_at":"2026-08-06T21:53:13.513529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:58.811072Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.811072Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7ead5dd299d261d467165b4e2f9b18d8beb7399302550b9eb6e54c9ac4442253","observation_id":"458a1831-5f2a-48fc-803e-39cdd608875a","resolution":{"observed_at":"2026-08-06T21:52:58.811072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21654","last_updated":"2024-07-31T14:56:42Z","snapshot_observed_at":"2026-07-06T18:55:07.177656Z","submitted_at":"2024-07-31T14:56:42Z","title":"MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment","version":1},"cited_work":{"arxiv_id":"2407.21654","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.21654","snapshot_observed_at":"2026-08-06T21:53:04.806413Z","title":"MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment","venue":"cs.CV","work_id":"81c6c3b3-b018-4554-8294-05337caa494b","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:58.917530Z"},"links":{"cited_paper":"/paper/2407.21654","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2efb7f65d202bf99c49eab54345608977860e53694928a95b8fd06af93837717","observation_id":"94ac9a92-49d9-42d3-8d0f-78cc8cc7c625","resolution":{"observed_at":"2026-08-06T21:53:04.929386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T21:52:59.052695Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.052695Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:6a5e53a3daaf79fdcc377d301e88ca49777af9c461ac9f96a264c5b70ac59c8c","observation_id":"e112cc66-d919-4cc3-b7ea-c1c26b72a5df","resolution":{"observed_at":"2026-08-06T21:52:59.052695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:59.155141Z","title":"Pla: Language-driven open- vocabulary 3d scene understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.155141Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:9d0803f063594af508a6e6d40ef4f42e7e046229bf070dc794cf89d7cd33b4e1","observation_id":"90af0a97-5bb2-413d-9280-9877aa54cf5e","resolution":{"observed_at":"2026-08-06T21:52:59.155141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.251527Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":"f80390e7-6db3-4faf-b86b-c9d27b48540b","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.243701Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ba58a2f86397600776589736e9011b013cc248aff387c2ecf42f000a282e4067","observation_id":"de2e4887-707f-4e28-96b1-bdf9f352fea9","resolution":{"observed_at":"2026-08-06T21:53:13.360728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T21:52:59.369243Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.369243Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:a468237f1fc19af2672833d195dc0915416d6b1c3d48d132955f50b9910abe09","observation_id":"44a72786-e440-4241-b3d0-a9436f35572d","resolution":{"observed_at":"2026-08-06T21:52:59.369243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-08-06T21:52:59.473536Z","title":"Imagebind-llm: Multi-modality instruction tun- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.473536Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3c87c45763bd08beee1b69f50f32fa801f5e0c131a6ce08005bb0a4a46995f21","observation_id":"ad57e631-7596-4529-8f48-cc1ce6ee5a4d","resolution":{"observed_at":"2026-08-06T21:52:59.473536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:13.066883Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":"d1733a03-751d-49e8-97a6-649a44dfe928","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.578599Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7147902a7f4d7340ea9afb116112efc721393bf76b9d428fcad0e7b17854e7dc","observation_id":"97ce80bc-d7d0-4338-a09c-467d0f2c3547","resolution":{"observed_at":"2026-08-06T21:53:13.146921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08168","last_updated":"2024-09-28T03:56:28Z","snapshot_observed_at":"2026-08-06T08:47:48.830818Z","submitted_at":"2023-12-13T14:27:45Z","title":"Chat-Scene: Bridging 3D Scene and Large Language Models with Object Identifiers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08168","snapshot_observed_at":"2026-08-06T21:52:59.681855Z","title":"Chat-3d v2: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.681855Z"},"links":{"cited_paper":"/paper/2312.08168","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:44ee12346f97d59a42b4e111028a82403f24eb7cece2881e4d441de78888e8c7","observation_id":"0f9edb34-9b72-4b97-8b5d-91ae6ec18f30","resolution":{"observed_at":"2026-08-06T21:52:59.681855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T21:52:59.769267Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.769267Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:bfaaf47e7b1927a9fc6e315dc88bf27ca022be68de07fe83b2bb91230c8519ae","observation_id":"34d95fbc-e937-4715-9210-663522ad7705","resolution":{"observed_at":"2026-08-06T21:52:59.769267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.847299Z","title":"Multi- view transformer for 3d visual grounding","venue":null,"work_id":"ed28737c-1514-4309-84d6-f005588f7719","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.867853Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:f2d1a4f758e754917b5ac315ef1640aa1b4a8c745c5fea4e50dd53c5c6e7c422","observation_id":"4b4618bd-cdea-4d2c-828d-1afa9f1c645b","resolution":{"observed_at":"2026-08-06T21:53:12.946706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09340","last_updated":"2024-09-24T03:18:24Z","snapshot_observed_at":"2026-08-03T02:15:01.826798Z","submitted_at":"2024-01-17T17:04:35Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","version":3},"cited_work":{"arxiv_id":"2401.09340","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.09340","snapshot_observed_at":"2026-08-06T21:53:04.396674Z","title":"SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding","venue":"cs.CV","work_id":"8302529d-a5bb-49c6-99de-1cedd65574ae","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:59.994335Z"},"links":{"cited_paper":"/paper/2401.09340","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:cd791346827cb00f2f912fa7f158fc8a9595544b604961a99a17af615275f643","observation_id":"62e5aba4-dde3-4665-b802-8ea3177c3189","resolution":{"observed_at":"2026-08-06T21:53:04.545494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.687235Z","title":"Guided point contrastive learn- ing for semi-supervised point cloud semantic segmentation","venue":null,"work_id":"81ee941f-5ede-4f44-ae24-bbf80a586a34","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.083655Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d34320b844d303085bb267ae132449fe050decaa6a08752d9e322b1c8a6928ef","observation_id":"ef4f5f50-f464-48c0-82e9-bf42cd0c62ed","resolution":{"observed_at":"2026-08-06T21:53:12.761403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-07-06T15:12:37.953383Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-06T21:53:00.204418Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.204418Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:7eb18dedb017cf8291b4759af4128464b04b7f2226d08464390334de59c208b2","observation_id":"831e018b-d7b8-4946-89c5-d2f9cd460c8e","resolution":{"observed_at":"2026-08-06T21:53:00.204418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.488390Z","title":"Oneformer3d: One transformer for unified point cloud segmentation","venue":null,"work_id":"61da9187-9143-43ce-abee-7098e1fefa93","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.306050Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d9af341ceb90efa52ccf72ca48c8f17d7ca6e0b3a2f0fcfd717065c5da65dd5d","observation_id":"7188b26a-7abb-4603-90da-ee7f35813e5a","resolution":{"observed_at":"2026-08-06T21:53:12.583338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.273351Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"1ecd2dca-240a-4f94-b8e4-651ceea1a063","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.437200Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8851f8281754566b43cf893b46252ad013e037a9debcd4d116302bd75c06f133","observation_id":"76ace732-993f-481d-af74-7ab8261c1a13","resolution":{"observed_at":"2026-08-06T21:53:12.403341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-06T21:53:00.558586Z","title":"Step-dpo: Step-wise preference op- timization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.558586Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:c62ee599cbfa699c75b957cfa43b29bfc5883c745c03ed0f9bd74fcd7b9d5efb","observation_id":"d9653dec-3380-4c78-8316-8b21d5210f57","resolution":{"observed_at":"2026-08-06T21:53:00.558586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:12.065254Z","title":"Large-scale point cloud semantic segmentation with superpoint graphs","venue":null,"work_id":"c2f9984e-61e9-424d-8cc1-a15f0c96eeac","year":2018},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.644188Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:40770d2358e3f9195098bec05e6b4b697372e41fe4ec459279734f8ea9af2b2b","observation_id":"b4becde9-e5fd-46d0-80c8-0fe3f452cab6","resolution":{"observed_at":"2026-08-06T21:53:12.158422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.861173Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"721174e6-779e-4bb9-abfe-c76079dad402","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.717881Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:317a277d7de4999c86c49bdba4dc20ecc9fb064029974676550687e1e88aed6f","observation_id":"dc14eb7e-771a-4c7f-b789-4daefd08ace7","resolution":{"observed_at":"2026-08-06T21:53:11.967553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03327","last_updated":"2024-01-09T06:20:23Z","snapshot_observed_at":"2026-08-03T07:23:58.026811Z","submitted_at":"2024-01-09T06:20:23Z","title":"Uni3D-LLM: Unifying Point Cloud Perception, Generation and Editing with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03327","snapshot_observed_at":"2026-08-06T21:53:00.799961Z","title":"Uni3d-llm: Unifying point cloud perception, generation and editing with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.799961Z"},"links":{"cited_paper":"/paper/2402.03327","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:e8c06ee9a72ecd9264eaebaeb25961a359d7d807bcc7d27b79f3ca6c702f6673","observation_id":"3ea31733-91bf-48ee-8dce-ef838f65b9e2","resolution":{"observed_at":"2026-08-06T21:53:00.799961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:53:00.901821Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.901821Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4ff3763f537656c5e4e3b67a02b3e95b6cf20bd4500402ca7bbc7d530de54c00","observation_id":"c4d0f4aa-fc8b-469b-bf92-4d7ef8153b75","resolution":{"observed_at":"2026-08-06T21:53:00.901821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-06T21:53:00.971816Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:00.971816Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:b572bba4374e693987fa3c4539002e474a632c91efdb8a5da97294cf2f64807d","observation_id":"27d46f3b-d777-4076-b839-5e64e9a65f93","resolution":{"observed_at":"2026-08-06T21:53:00.971816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.679247Z","title":"An end-to-end transformer model for 3d object detection","venue":null,"work_id":"daff00a6-c8c8-4dad-9b01-6429ae4450b3","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.046044Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:fbfa1624c119d9e32dc4601c2b713ea496fd43a5ffb443bedf87109d8d6e8020","observation_id":"146b51d3-c45f-413a-90dd-24a29d730431","resolution":{"observed_at":"2026-08-06T21:53:11.753791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.515115Z","title":"Boosting few-shot 3d point cloud segmentation via query-guided enhancement","venue":null,"work_id":"6c4114f3-542e-43c9-812a-59609f66cd87","year":1904},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.149234Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ef0218cbb3b8509173ec690e6ea1b36a8cd36428eea18fb4093fc560f2d24ee1","observation_id":"dd071416-a327-43c7-a1db-a6996a849c5f","resolution":{"observed_at":"2026-08-06T21:53:11.575644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.317482Z","title":"Hierarchi- cal dense correlation distillation for few-shot segmentation","venue":null,"work_id":"4a755f0c-a501-4e65-b163-a2e6e8d318a6","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.255571Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:67958e06f6e5556ab663a6bf4b348595ee49e282cdc4b1935b29fc59c9338d87","observation_id":"50ced8bf-31e5-4b03-8fc6-e2c65b4f4d2d","resolution":{"observed_at":"2026-08-06T21:53:11.421226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07470","last_updated":"2024-04-11T04:22:15Z","snapshot_observed_at":"2026-08-07T09:52:49.159319Z","submitted_at":"2024-04-11T04:22:15Z","title":"Scalable Language Model with Generalized Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07470","snapshot_observed_at":"2026-08-06T21:53:01.348484Z","title":"Scalable language model with generalized contin- ual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.348484Z"},"links":{"cited_paper":"/paper/2404.07470","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:528c72f7f80dfbce5e5d48cbee3d11b3a2c8f25411d33dbcd3f9f6d64178f732","observation_id":"f7cae70b-0dc2-4b0c-8eb7-ce7ca5f1d669","resolution":{"observed_at":"2026-08-06T21:53:01.348484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:11.081413Z","title":"Oa-cnns: Omni- adaptive sparse cnns for 3d semantic segmentation","venue":null,"work_id":"5e99ffc0-17f1-473c-a590-23a50795ac21","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.438300Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8cd450b769c00b4abef57c1ebd1de1bc802d397a7540c38542b1cfcf7f709d18","observation_id":"584d8855-8324-4fd3-aae2-bdc8b758c3ba","resolution":{"observed_at":"2026-08-06T21:53:11.173646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:01.538579Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.538579Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4a388b97b3fcb1dc34e202a8c4a130d8b74008f24e42ec7cd6666c88bda0e5b9","observation_id":"0d582eb0-37e5-4246-a451-0eb88695eccc","resolution":{"observed_at":"2026-08-06T21:53:01.538579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.911005Z","title":"Explore the potential of clip for training-free open vocab- ulary semantic segmentation","venue":null,"work_id":"dfe0c110-d997-4140-9b35-82fbc143cc3f","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.634815Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:106cb11a5fa23478cfd2d6bedf4dc6b2ae1d0962f8c9ac151b88f6df022e39ba","observation_id":"56dc775b-f6a2-446e-a8c0-172202b6e50c","resolution":{"observed_at":"2026-08-06T21:53:10.983916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.738470Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":"1d9bb422-6ea6-4537-8785-9ca3a0bd0fd6","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.702626Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:af5a9535bc4b6a5c5307f457cc4874fcf36b14151c66c0551ecc0689eec1b144","observation_id":"61f5a869-bb7a-4f88-b675-271d3b0fe13b","resolution":{"observed_at":"2026-08-06T21:53:10.816844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-05T15:00:57.933479Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-06T21:53:01.780508Z","title":"Open- mask3d: Open-vocabulary 3d instance segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.780508Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ce09cdb359fd72269f84f5119324b235ac1eb8c8590d8c8e730529e22a07e6c5","observation_id":"1096ace6-d48f-4595-b0ac-f2ab5e1a36b7","resolution":{"observed_at":"2026-08-06T21:53:01.780508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.497389Z","title":"Mind the interference: Retaining pre-trained knowledge in parameter efficient continual learning of vision-language models","venue":null,"work_id":"268fd848-1082-4750-a2ac-de706853b77e","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.855126Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d14ddea20de3995f48f7d9598f259dbc1cb96153be8a67d12607ecd6eda35f74","observation_id":"78a01afb-911b-4a4b-b494-590f26f7df4c","resolution":{"observed_at":"2026-08-06T21:53:10.628744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.312428Z","title":"Learning shape-aware embedding for scene text detection","venue":null,"work_id":"496399f6-a298-4173-9625-804d12f406da","year":2019},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:01.946814Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:878b7b279ceb921ff594f830baa29905cabe8815eed43770488ebc6387383f33","observation_id":"934c49e3-811d-49b1-b6ca-78cb5612802d","resolution":{"observed_at":"2026-08-06T21:53:10.428096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:10.091141Z","title":"Prior guided feature enrich- ment network for few-shot segmentation","venue":null,"work_id":"3b05af9f-e9ab-4bc0-8bf8-12efec1c6bc5","year":2020},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.042318Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2f2b752282a1afe2926c537681d5dd8d62ed928fb46a0d8bfc2d7ab4461e9daa","observation_id":"0c26d983-be1a-410b-ae62-43726fbc61fc","resolution":{"observed_at":"2026-08-06T21:53:10.189030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.883184Z","title":"Adaptive perspective distillation for semantic segmen- tation","venue":null,"work_id":"9c765bd4-2abc-4c77-8d4f-c41795d40434","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.106679Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ae167d853a921310d40e2441cb1123d3b17b0edac108b962654fc3bff9669d8d","observation_id":"8e314eef-7b3c-45b6-b717-432117460287","resolution":{"observed_at":"2026-08-06T21:53:09.980659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.673192Z","title":"Generalized few-shot semantic segmentation","venue":null,"work_id":"ba9fe601-ea8e-4a8e-a01f-458f83749df2","year":2022},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.173893Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:0de9830ca43462acaec30bb74d0f1e90c24bf5ccf7e003ba906563947857d156","observation_id":"17d04d7b-54fd-4bcc-8dec-367477883c72","resolution":{"observed_at":"2026-08-06T21:53:09.786638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.520794Z","title":"Learning context-aware classifier for semantic segmentation","venue":null,"work_id":"6291194a-edce-4581-9980-2b472e3e1640","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.264287Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:76b9406b809cc9fe245619a5f1c4ef0c7c75f7d01a0f6991b734e27d810f9672","observation_id":"8cc5ac61-fe44-428f-8d39-d6f24a46680b","resolution":{"observed_at":"2026-08-06T21:53:09.577862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-02T00:22:05.597306Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-06T21:53:02.361077Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.361077Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:43c4cfa64f9cf8d0639aca72b1a64a9c98d582308d70d8b3ca38cd2f6a7c5138","observation_id":"04974178-964d-4fc1-abcf-d397d4456184","resolution":{"observed_at":"2026-08-06T21:53:02.361077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-06T21:53:02.436049Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.436049Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:52f234ebb701968c4c8e996961a2783088164eb99acd712fe440997ab98bbd9b","observation_id":"19030596-2323-44f8-bf0a-ff83d7969880","resolution":{"observed_at":"2026-08-06T21:53:02.436049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16911","last_updated":"2024-09-06T22:45:43Z","snapshot_observed_at":"2026-07-06T16:12:55.132006Z","submitted_at":"2023-08-31T17:59:46Z","title":"PointLLM: Empowering Large Language Models to Understand Point Clouds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16911","snapshot_observed_at":"2026-08-06T21:53:02.513697Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.513697Z"},"links":{"cited_paper":"/paper/2308.16911","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:13a17491db9cfc8a50ce453bf629c63be6f76178d3e38e71f82cc6ee2a7e7e8f","observation_id":"8e24a87e-fa6e-47ec-80aa-350393141259","resolution":{"observed_at":"2026-08-06T21:53:02.513697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.351581Z","title":"Llm- grounder: Open-vocabulary 3d visual grounding with large language model as an agent","venue":null,"work_id":"c8eb1879-d152-452d-bfa0-8960cb6018d1","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.621278Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:65e75faa561c94787df16c565c9713dbc70a92311723e99b101da9a1821cf887","observation_id":"cd0acc59-f07b-445c-a6af-dd175fe92d31","resolution":{"observed_at":"2026-08-06T21:53:09.433475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T21:53:02.670233Z","title":"Lisa++: An improved baseline for reasoning segmentation with large language model.arXiv preprint arXiv:2312.17240, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.670233Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:dd50638a0eced4d0305f0b1162954205b270ab4da64b7b29e6d23e8881e0f15d","observation_id":"222944e9-9eef-4452-891d-bcb190a9e218","resolution":{"observed_at":"2026-08-06T21:53:02.670233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.219874Z","title":"Unified language-driven zero-shot domain adaptation","venue":null,"work_id":"4d130971-04f8-4c52-9e25-d9b6e20c8d2f","year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.785477Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:5551e02b311322c51cbc29acfc657e609d7c3a26990b5af9a1adbeffac959961","observation_id":"691d61e1-8cbe-46c6-bf68-9bd49f55c352","resolution":{"observed_at":"2026-08-06T21:53:09.286190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:09.076750Z","title":"Visionzip: Longer is better but not necessary in vision language models","venue":null,"work_id":"5ca6c3fa-ec68-4592-80d5-1892f970d439","year":2025},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.857736Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:40faa5880d2057c2a94697e2369b60bdc556f391d87248200943662fe5be45a8","observation_id":"e364c948-8f20-4ccd-9c55-f72f539d2bca","resolution":{"observed_at":"2026-08-06T21:53:09.155714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-06T21:53:02.923647Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.923647Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:30a6eef85257dbfacfcefad54b6238ae6cc396f66c0986299cf50ce63a27f795","observation_id":"59b157f9-8fa1-4d26-9496-c327aeed8fc7","resolution":{"observed_at":"2026-08-06T21:53:02.923647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-06T21:53:02.977100Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:02.977100Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:501e613f5c013b931de171d7a85e138fac87240eae04502628c9cc53063a9c3b","observation_id":"5ab31b1a-6074-49f5-a2cf-f4ec5ac7f4da","resolution":{"observed_at":"2026-08-06T21:53:02.977100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-06T21:53:03.034745Z","title":"Opt: Open pre-trained trans- former language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.034745Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:4a969645cd133a1b336e471901ef19dfc3016b1c79e9ee8415deda85ab03dae7","observation_id":"944d160a-1c9a-4f48-a492-c43445372d40","resolution":{"observed_at":"2026-08-06T21:53:03.034745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.916807Z","title":"Multi3drefer: Grounding text description to multiple 3d objects","venue":null,"work_id":"fda8297b-c292-44b4-bd12-2998a8342e7f","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.093626Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:8aa68e884b2296be3faf92563b84daa4b1575322bbbe1bb996770eb5ff986fb8","observation_id":"1ea536c1-6748-486c-aed5-8131ee72c7df","resolution":{"observed_at":"2026-08-06T21:53:08.978931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.759363Z","title":"3dvg- transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"4144d986-ebc4-4049-b301-f0515263a069","year":2021},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.159558Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:cd42a6d6f33ac5b432307b01ad30bf8a9380be40755b48fb3f39e5a47a5d4abd","observation_id":"ce0c7d61-939f-4525-b2a1-c6a915a0a248","resolution":{"observed_at":"2026-08-06T21:53:08.839030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01525","last_updated":"2024-07-17T07:07:43Z","snapshot_observed_at":"2026-08-05T00:22:51.049515Z","submitted_at":"2024-07-01T17:59:35Z","title":"ScanReason: Empowering 3D Visual Grounding with Reasoning Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01525","snapshot_observed_at":"2026-08-06T21:53:03.225641Z","title":"Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.225641Z"},"links":{"cited_paper":"/paper/2407.01525","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2ec0a0497dd08dcb16bebb85b5cfe1cfdabc09a3d4b72561291045c96e0ba91a","observation_id":"5fd12392-a455-441a-8630-a817b0b433fe","resolution":{"observed_at":"2026-08-06T21:53:03.225641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T21:53:03.285974Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.285974Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:528b67dfd3b020eb36076d5a5b849223c57c98cf65227d96f42d0e0f6867b264","observation_id":"8820c6be-a73e-4ae8-a85b-38ae4e588bf0","resolution":{"observed_at":"2026-08-06T21:53:03.285974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.560310Z","title":"in the right of","venue":null,"work_id":"e3efdace-61c7-4881-a0ca-365a958812a4","year":2023},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.364743Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3c62de0a099b602afc5f884e0846047399c5aece1a860b44131f12f4d31f4a12","observation_id":"c264643a-7b76-4de0-9b77-f692ca3febba","resolution":{"observed_at":"2026-08-06T21:53:08.641534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.409073Z","title":"Focus on detecting and distinguishing objects","venue":null,"work_id":"7c57570b-7690-4c73-b6b3-b89d7ca63673","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.415149Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:d450c0da059c80f5fd4cafee69e54483499e16987de2ae13bc8c7f92c1566dd1","observation_id":"79c14c01-dd42-438c-8312-73dd76869e8b","resolution":{"observed_at":"2026-08-06T21:53:08.491329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.258244Z","title":null,"venue":null,"work_id":"6c529cca-ee5c-47e3-a393-953b7e164914","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.466751Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3bb123e42b99db8ac4baa3d948b9eea3170942b74bace943da0eb5d2a96983e3","observation_id":"325f6a96-a76f-4951-8e96-bad0ba2a8387","resolution":{"observed_at":"2026-08-06T21:53:08.344472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:08.083986Z","title":null,"venue":null,"work_id":"02620e1d-4f84-437b-92b6-8cdd92a39d6e","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.522108Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:2e8999c7fd6a4b243cd11b447def6d7187184cc0ab961ead563115110124c780","observation_id":"05db9656-4a26-484c-add9-192c02bf0113","resolution":{"observed_at":"2026-08-06T21:53:08.151275Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.944779Z","title":null,"venue":null,"work_id":"2dc41ce9-addf-43ad-a1b0-ca78cc69ebc9","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.581218Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:6a8d0d85c5e2612a8a6f8697cc93f0992758934c6708549bed3418ed51e60db9","observation_id":"560ad566-91ec-441d-af03-e42af7682409","resolution":{"observed_at":"2026-08-06T21:53:08.004162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.737904Z","title":null,"venue":null,"work_id":"1afa169b-07d3-4c92-ad55-126e3a0a53c2","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.628077Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:82791ac0a4872b17f1f0ad44e19cd4455fc737a0c84cbf1d25577523996fe222","observation_id":"61cf7d28-9358-4867-85b6-8c1c07519fab","resolution":{"observed_at":"2026-08-06T21:53:07.821554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.597115Z","title":null,"venue":null,"work_id":"f8d44fc5-f9ba-4014-a1eb-988eb99f504d","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.675226Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:ffd3d5beb3000e67195748668856f1efc9aaf48f5435fe67b9e01ca371df4623","observation_id":"ac8e90e1-e941-4283-8a6f-0a8799e076db","resolution":{"observed_at":"2026-08-06T21:53:07.673168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:07.307565Z","title":"For multiple objects of the same category, use [<ins_id>][<ins_id>][<ins_id>], etc","venue":null,"work_id":"f8abeb94-bb9b-4a39-bdb8-3fb2bdd8b99b","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.739329Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:0badac6e21800f765e647733ad9babbb2edc45aa66bc278f1de97f9db8654bda","observation_id":"ba3b2e56-4854-4d61-ad78-6809cc68d482","resolution":{"observed_at":"2026-08-06T21:53:07.463313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.963959Z","title":null,"venue":null,"work_id":"929158fd-cbf0-4d99-a210-ea36ca744855","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.785678Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:0887bfdfda96c8b9afc707d51931c76f2cd5a795eeb666ffed50452d06696000","observation_id":"90115f2d-f5d1-4533-8061-275982f0466d","resolution":{"observed_at":"2026-08-06T21:53:07.134037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.648244Z","title":null,"venue":null,"work_id":"b39d25d0-3117-4b0e-bc01-bece9656d388","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.839144Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:afab9d785df1116d4388344cb1002d8787ac1699f7078c6741930343d7c68ec8","observation_id":"83c98ba2-e58d-42af-8cde-eca333407c73","resolution":{"observed_at":"2026-08-06T21:53:06.791230Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.355297Z","title":"Don't output anything else","venue":null,"work_id":"8771a57c-2523-4587-87b7-f7058898442a","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.898635Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:cb0c504a0239d2caf826379a0c26b871c362b7aa0c4572dafb87966dbf795f00","observation_id":"684938be-0073-4770-8639-a5573a11fc08","resolution":{"observed_at":"2026-08-06T21:53:06.518179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:06.034235Z","title":"Analyze the properties and spatial relationship of objects in the scene","venue":null,"work_id":"cb70d54a-c9b3-4ecd-8ab7-2f741f01549d","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:03.961199Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3a3c4e1e426c9353e639f30f06e0a01f7116a712174ca1fccd471caf00d16ec1","observation_id":"dfe122b5-8d40-4404-9fa1-d59bf2f82354","resolution":{"observed_at":"2026-08-06T21:53:06.182178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.817853Z","title":"Don't output anything else","venue":null,"work_id":"71244d5c-3465-476f-b230-f02120b0c719","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.025687Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:edf0fe08b84548fc333651d298ef2aae194d55e3e859cc51ae5db94c65d186a5","observation_id":"555da127-ea1a-47e9-93b8-43a22e8f0a3c","resolution":{"observed_at":"2026-08-06T21:53:05.893817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.613628Z","title":null,"venue":null,"work_id":"d8aed0b1-580a-4b31-a8de-e167c798cd72","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.088203Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:eb275fa2645c42503fe8a43dfb0b4b5f39a7bebc27c184f181fe541d03d6008a","observation_id":"1dc3a3b7-e30e-4d0a-a3b0-e4bf029bbf62","resolution":{"observed_at":"2026-08-06T21:53:05.705709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.413608Z","title":"Analyze the description and identify description-related objects","venue":null,"work_id":"ef4f85ff-bbaa-492a-9a91-4deb9c417ce7","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.123579Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:945a8747f5c8a24e69ab826f4ab3312a5d71ccad95611429ab8e593dc4333a8d","observation_id":"0c966068-2eff-4233-b2eb-aea3fb3858e4","resolution":{"observed_at":"2026-08-06T21:53:05.526378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:53:05.149101Z","title":"Don't output any other things","venue":null,"work_id":"44872d76-9a90-47f2-b837-4a86fb8afa58","year":null},"citing_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:53:04.127385Z"},"links":{"citing_paper":"/paper/2506.23120"},"observation_digest":"sha256:3ce0ad78cdaf544bf1fe096383f27f3540b3fcdac37d17b20386e0398b03c435","observation_id":"4ab6c0e7-5250-42a7-a73c-9fe22efa05d4","resolution":{"observed_at":"2026-08-06T21:53:05.267420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":41},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 1 inbound Pith citation observation for arXiv:2506.23120."}