{"as_of":"2026-08-19T17:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f482f66b081d76a3478c656b086ab1c0ae169bcdef577c6b0ff611112d9137d","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:16:06.304920Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.10278/citation-record","integrity":"/paper/2608.10278/integrity","json":"/paper/2608.10278/citation-record.json","paper":"/paper/2608.10278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.098155Z","title":"and Han, Rilyn and Fei-Fei, Li and Xie, Saining , title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.098155Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:b4e1403cbc5f1d4148af52befc9d7d090359ac15f6ae19b08320273c33fcb6b1","observation_id":"a048de66-c3c5-4f1b-a8f8-a17296a9532e","resolution":{"observed_at":"2026-08-14T04:16:06.098155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.707992Z","title":"2025 , eprint=","venue":null,"work_id":"53c6f9da-2525-4e1d-abf6-021cd934f775","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.105261Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:64f1c58cd7ea1d658c43d53e8a95742af32e5fb9c0e57466b67ab64945298f2f","observation_id":"89999f83-87a5-4da9-b401-41dafaa82bed","resolution":{"observed_at":"2026-08-14T04:16:07.712507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.695097Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data , url =","venue":null,"work_id":"f2b6737c-f500-4db1-b70d-43a18c90b12b","year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.109356Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:91913505749c0c73a22bd8f26836c46530d71c89529f279adfb3b534eeae57c7","observation_id":"aa9e10aa-50c4-48cc-9c1a-9284b0affd2e","resolution":{"observed_at":"2026-08-14T04:16:07.699483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.680772Z","title":null,"venue":null,"work_id":"437c6316-b377-41c4-b973-dbcae4a03240","year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.113547Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:f94695c7aab5ec055a32c8a04b6f9a1cd98adc04cb00b72bff1077baf5d9872d","observation_id":"bcaf662b-6c9f-4dec-b564-7e86b4b05cf8","resolution":{"observed_at":"2026-08-14T04:16:07.685314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.119929Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.119929Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:6025e4c3691441142b3f180f82c053c5e2878676119b05a063b7f2a9ca9360d9","observation_id":"77531e96-2392-449e-aace-12227ee86910","resolution":{"observed_at":"2026-08-14T04:16:06.119929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.658155Z","title":"2026 , eprint=","venue":null,"work_id":"f13c3791-3077-4a92-b392-25cde1d2c9f1","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.125646Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:d5a7ed878092ae8f350b0a6bc8ba742a07b5afd3a4b729efef6ec902c40fc757","observation_id":"0dd7f347-cbf8-4132-b9d5-125184b65256","resolution":{"observed_at":"2026-08-14T04:16:07.662456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.131624Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.131624Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:cc9408930c013d837965e8c426f3446fbfebc48bb0b1f7f9e819e7fee203245b","observation_id":"842b44ff-c10d-47af-a083-3e98cc92e8c9","resolution":{"observed_at":"2026-08-14T04:16:06.131624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.135857Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.135857Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:d8bd8bd3710cbb10fd86200f01de7f09fcf6a3136a39635e6d73ca19d0272b77","observation_id":"5068f620-fae6-4c6a-a281-fa5a19d51b4c","resolution":{"observed_at":"2026-08-14T04:16:06.135857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.148875Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.148875Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:f7d8dea07ea87873427490c9cf172adf7b94c93a9b7b4ba0e9ad5b102e28fada","observation_id":"56c5f222-19a9-4817-874e-2b5263b67153","resolution":{"observed_at":"2026-08-14T04:16:06.148875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01805","last_updated":"2025-05-21T09:38:44Z","snapshot_observed_at":"2026-08-16T19:57:59.994547Z","submitted_at":"2025-04-02T15:12:17Z","title":"SpaceR: Reinforcing MLLMs in Video Spatial Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01805","snapshot_observed_at":"2026-08-14T04:16:06.153749Z","title":"arXiv preprint arXiv:2504.01805 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.153749Z"},"links":{"cited_paper":"/paper/2504.01805","citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:2cda2b7e3ab1d2fda96578cfb58b23964d4e7e7fd5f19f54dfa63de958fbbee6","observation_id":"81f8cced-5111-477d-8a6d-f46e45e074a7","resolution":{"observed_at":"2026-08-14T04:16:06.153749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.590822Z","title":"2025 , eprint=","venue":null,"work_id":"f1e82c60-bacf-45da-9cf1-c4bce8986ffd","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.158133Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:555d5ffc4f4e39612960f7b151405342c3acdcb27f0db4d0ff16c6244d2b9a5b","observation_id":"0a4d1178-3f1b-4f98-bfd0-9c0c5eff08ef","resolution":{"observed_at":"2026-08-14T04:16:07.594502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.577153Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence , url =","venue":null,"work_id":"5ddadaf4-3fb6-4835-a96e-b1588903a520","year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.164256Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:ceb34b2023e76e018341bde6785a245e7f066b767fbbb3482b8fc39375747d9f","observation_id":"1f8f3b33-1211-48ca-8edc-72981be6719b","resolution":{"observed_at":"2026-08-14T04:16:07.581548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.543282Z","title":"2025 , eprint=","venue":null,"work_id":"57297749-aa74-4ef2-b237-4a40b156cdf9","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.168944Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:ab50fb82228d71f10ada3f002c025744f635ba3f032d2a8b08211389927e5e93","observation_id":"a21c4ee0-4a45-4b18-8446-3375ad32ca0e","resolution":{"observed_at":"2026-08-14T04:16:07.555514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.526563Z","title":"2026 , eprint=","venue":null,"work_id":"f3cf6149-5c62-4d8e-8c11-e2d8e8f6df9f","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.173679Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:076cf7e176c1f9b3c2ee24f844a38fe4f61a096faefa1a4fc5aea106ede07708","observation_id":"e5544cca-8d0c-4bf2-ad6b-6ba3e7bdf40d","resolution":{"observed_at":"2026-08-14T04:16:07.530586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.499283Z","title":"2025 , eprint=","venue":null,"work_id":"3b12ba92-ac7f-4ac5-bb4e-447d9bf08c79","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.178280Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:c3f27d2c4d4bc43fd88a0377bbdbcb7178704c6a87ab74846b5af64460733276","observation_id":"5054642a-2078-4cb6-8af7-964696b9bf08","resolution":{"observed_at":"2026-08-14T04:16:07.505341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.486429Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , month =","venue":null,"work_id":"f8708215-dd2d-43d8-8d83-386c76071c2d","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.182292Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:6b024c5233bba1c8b375884d2146602d9778571d56838e5a04867a9ef486cd66","observation_id":"0c4c09ec-57fd-4b59-9cb4-0a7f295fda9f","resolution":{"observed_at":"2026-08-14T04:16:07.490857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.473567Z","title":"and Saenko, Kate and Krishna, Ranjay and Guibas, Leonidas and Chu, Wen-Sheng , title =","venue":null,"work_id":"0a7efdca-6599-4669-b4bb-9fd6eff65285","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.185853Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:d9acb54a853978ac3aeb1e53aeadf84ead72a888bb2f96aa6d884ad410027198","observation_id":"8fc276b4-a6d9-4866-bacf-058391c57cbc","resolution":{"observed_at":"2026-08-14T04:16:07.478356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-17T03:34:43.784005Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-14T04:16:06.189513Z","title":"arXiv preprint arXiv:2511.19418 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.189513Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:8f7f3d9de7405e270bfc9933e4eeb885e56d2accf46bdc4f4e9db5807a9fe83c","observation_id":"d1c4922b-b9c9-4a04-b667-3d21bc76b694","resolution":{"observed_at":"2026-08-14T04:16:06.189513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.459503Z","title":"2026 , eprint=","venue":null,"work_id":"6adf7302-2e41-47b7-a59b-41e45a22dd6a","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.193944Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:5aa1c27b373b34081ba2498f8420f1077384e63c587e5d6cc55f808e2ea57d18","observation_id":"80c287ae-7989-4b66-809b-b47517fafa22","resolution":{"observed_at":"2026-08-14T04:16:07.464611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.447468Z","title":"2026 , eprint=","venue":null,"work_id":"e3304e44-fed4-47c1-af7e-7183fda2d83c","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.207574Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:d02c32d1c7d3481536b73bb65409bc42a28d21b137a2d04a69eaf6a74367ec98","observation_id":"79d57768-cb70-43ea-8934-894b865776b9","resolution":{"observed_at":"2026-08-14T04:16:07.451597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.424747Z","title":"2025 , eprint=","venue":null,"work_id":"889f78ba-7269-41c4-9e3e-6b5979129841","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.211416Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:ad122fcc10b694ded72a62c7cf1559827ca13af1ceed7cea3350a3e86b44a175","observation_id":"df96d802-e41c-49d1-bb56-7eaf8bbcec90","resolution":{"observed_at":"2026-08-14T04:16:07.438470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.396848Z","title":"2026 , eprint=","venue":null,"work_id":"f5d7016e-3424-4168-8fa4-c3f4a8bcc9da","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.217737Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:c536944a2a79165309f675c1ecfd9f562e59ba88dd3873a8db7e181f1105b1a6","observation_id":"7901008e-b669-48a8-b0a6-a464788b3a4b","resolution":{"observed_at":"2026-08-14T04:16:07.401393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.221915Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.221915Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:53f4ff3285438ee64264372700bd0f91c88cd8a25452c0283bd917b18b8097d8","observation_id":"40fbdaea-d985-40e5-bd40-23edb8cd8d22","resolution":{"observed_at":"2026-08-14T04:16:06.221915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.225825Z","title":"DUSt3R: Geometric 3D Vision Made Easy , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.225825Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:edc97c9a400100097f5649f45ef124cd01be5013940df37d45e793da88e2743e","observation_id":"4ed25394-c91c-4307-a56f-eec7d7724674","resolution":{"observed_at":"2026-08-14T04:16:06.225825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.230458Z","title":"VGGT: Visual Geometry Grounded Transformer , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.230458Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:595b28ed2e8906861b517616610c623a86cdea1543b3699ef83000fa2df12370","observation_id":"ff9da692-a220-49af-9a59-947ef4d496a6","resolution":{"observed_at":"2026-08-14T04:16:06.230458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.351068Z","title":"2026 , eprint=","venue":null,"work_id":"28d6f606-c3b0-4dff-a562-a00bf7c55c9b","year":2026},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.234573Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:e174a6de47b13c09fd920c8048f08bea4c92d3952fbeedd7f3fa1e529b5056cb","observation_id":"48ce547a-ba16-426a-9594-bc100ccc0cb2","resolution":{"observed_at":"2026-08-14T04:16:07.360021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:07.315270Z","title":"2025 , eprint=","venue":null,"work_id":"5852b7a0-7729-4245-8010-2486e9ecc0a3","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.238191Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:4a4c4fc1b9ad8dfce9c01e46d56c6abac47f185e233b45f3ed760e1ce87495e3","observation_id":"4ef36d43-f8b2-4c9e-b809-7961530eec03","resolution":{"observed_at":"2026-08-14T04:16:07.319594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.241882Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.241882Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:f6f336cd45e7a233df823c444d90d28122821a2e38d4b6a79b4a0888e92627b3","observation_id":"65b64441-4b1b-44b4-998b-a3d0b4f3b6cd","resolution":{"observed_at":"2026-08-14T04:16:06.241882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.245541Z","title":"2023 , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.245541Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:67917523eedb18408dab09567f70615deef41b50887f68852dc444f7873cff6d","observation_id":"d393e972-2053-47dc-b658-906965d3641b","resolution":{"observed_at":"2026-08-14T04:16:06.245541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.249252Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.249252Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:f9cceb86cccaf2beb9449a3c1531100f9852f0120c466a1438ae1258a8a22d68","observation_id":"5b8be4d3-5cf3-44d4-9520-60cd72021c46","resolution":{"observed_at":"2026-08-14T04:16:06.249252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.252750Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.252750Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:7295d665078bac05f21109919626ec07bef423aa575702c84b3e59f8ae13124c","observation_id":"12ce40ad-eff6-4611-bfb6-7e44a38465cb","resolution":{"observed_at":"2026-08-14T04:16:06.252750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.256910Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.256910Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:c126c4955edddfaeca923f6588a9546c551f6b27bf292463932473af05d062cf","observation_id":"7084bdeb-3698-4f52-98ee-bf46996ba7a0","resolution":{"observed_at":"2026-08-14T04:16:06.256910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.260581Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.260581Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:262efa0ab419788c772c68f43c7b90a2345013dc0dc3cb9a0efce61dcd07d2b6","observation_id":"82a5ab25-45f0-4b36-bff7-330e0d835fe8","resolution":{"observed_at":"2026-08-14T04:16:06.260581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.264998Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.264998Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:756cc68337142d76857408f6302d55e144d7ec1dbb69335c298b1d28995605e8","observation_id":"e4856399-78a1-4000-b370-d19c29453c6c","resolution":{"observed_at":"2026-08-14T04:16:06.264998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.268674Z","title":"arXiv preprint arXiv:2512.16561 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.268674Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:f35530faca2adfb16b4836c9c964e4f85b34050fdaa2d47f689f96f1a5aafa21","observation_id":"e382c2bf-45a9-4486-a5fe-728f85e4e734","resolution":{"observed_at":"2026-08-14T04:16:06.268674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.272360Z","title":"arXiv preprint arXiv:2511.20648 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.272360Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:6f140789e32e5d64469fecae1c8e866454bccc2b05695e13035d4309dd8134b1","observation_id":"5b56c2c9-ad05-4a87-bc8f-c6ae39cffa23","resolution":{"observed_at":"2026-08-14T04:16:06.272360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10946","last_updated":"2026-04-15T01:06:55Z","snapshot_observed_at":"2026-08-18T11:58:19.134424Z","submitted_at":"2025-11-14T04:16:09Z","title":"Abstract 3D Perception for Spatial Intelligence in Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10946","snapshot_observed_at":"2026-08-14T04:16:06.276162Z","title":"arXiv preprint arXiv:2511.10946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.276162Z"},"links":{"cited_paper":"/paper/2511.10946","citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:05f4e6ae644103057f823b16ab372f209a551f773f009dfb93ddebddfafe8c5c","observation_id":"e0ed8563-706a-4356-8dc2-90244b2d4e36","resolution":{"observed_at":"2026-08-14T04:16:06.276162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.00409","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.457931Z","title":"arXiv preprint arXiv:2603.00409 , year=","venue":null,"work_id":"80ae921c-9af1-46d3-a245-b42b82eaad9d","year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.280152Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:cfb48f29f6eb0803b0c860e696f5cc130424a44cb9d7b8967e193121d26fddbb","observation_id":"0399d557-9803-45a7-911c-56396225da80","resolution":{"observed_at":"2026-08-14T04:16:06.520498Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.284460Z","title":"arXiv preprint arXiv:2603.05591 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.284460Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:5f5dc9fdf33a63b320639416d502a98cd75ecaf91689da941c0e5895a0a08e15","observation_id":"b7d45d47-2d83-48f4-9b2a-b4435f195216","resolution":{"observed_at":"2026-08-14T04:16:06.284460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.993871Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"903996bc-9912-40f5-990d-4102150eff3c","year":2024},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.288452Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:068e20f928c265bd4d3075d62ef1b1e9ecf8e579f14f2f800d25d3fb89a117e1","observation_id":"6618bb78-667c-4abc-81f7-0ae82328503d","resolution":{"observed_at":"2026-08-14T04:16:07.100599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.292308Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.292308Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:3f57b05c8486fbad76eafe42c02d48d39389419fce07c8a9ce8b6c8c62e4a8c8","observation_id":"de951d94-bbea-4c11-aa9e-1b575b7a308d","resolution":{"observed_at":"2026-08-14T04:16:06.292308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.974347Z","title":"The Thirty-eighth Annual Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"7c822e97-ecc0-407b-b2cc-5db7cc8ac7e9","year":null},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.297394Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:2caaa9336e75b95fa9f903ee1afef808dbf9a7e25779d10a3c23083427101c7d","observation_id":"090025c8-624c-4946-95a9-c39af4443988","resolution":{"observed_at":"2026-08-14T04:16:06.978567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.961239Z","title":"2025 , eprint=","venue":null,"work_id":"7b224f11-1d37-4ca0-b393-57a3877640b1","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.301321Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:b691d25767ef67d7c0bb2f3ca32a844908e0f01abaa6945a549238870c73f832","observation_id":"34e5db0e-208c-40d9-92a4-925aa8c461d8","resolution":{"observed_at":"2026-08-14T04:16:06.965836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:16:06.828524Z","title":"2025 , eprint=","venue":null,"work_id":"96a035aa-02d9-4dbc-8158-afe41597748b","year":2025},"citing_paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:16:06.304920Z"},"links":{"citing_paper":"/paper/2608.10278"},"observation_digest":"sha256:b5e7e876fa01b40881bf5652fb34d965bc4ff268c4ca8dc3956e344b43c39b2d","observation_id":"dea5c195-f580-48aa-b7bd-dc1335f1c166","resolution":{"observed_at":"2026-08-14T04:16:06.916028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.10278","last_updated":"2026-08-10T22:20:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T15:42:10.284654Z","submitted_at":"2026-08-10T22:20:07Z","title":"Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2608.10278."}