{"as_of":"2026-08-17T02:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bea05375d98e372bc51a1ab7f7487bcc578469375a8735e8fa98aa7f34c91b8d","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T06:31:04.432486Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:04:38.497190Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19528","snapshot_observed_at":"2026-08-01T07:04:38.497190Z","title":"arXiv preprint arXiv:2605.19528 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21595","last_updated":"2026-07-23T17:59:59Z","snapshot_observed_at":"2026-08-10T01:48:42.593503Z","submitted_at":"2026-07-23T17:59:59Z","title":"3D-Aware VLMs with Implicit and Explicit Geometries","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:04:38.497190Z"},"links":{"cited_paper":"/paper/2605.19528","citing_paper":"/paper/2607.21595"},"observation_digest":"sha256:7ab51f77ccf61522d91b65a4a5d1bb1856c0e07fa361d111c05f24db5ce13c4a","observation_id":"7af2ca59-638c-4623-b582-eed7b3e31756","resolution":{"observed_at":"2026-08-01T07:04:38.497190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19528/citation-record","integrity":"/paper/2605.19528/integrity","json":"/paper/2605.19528/citation-record.json","paper":"/paper/2605.19528"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning.Advances in Neural Information Processing Systems, 35:23716–23736","venue":null,"work_id":"c0a12eb0-9792-4256-aca4-a4a7aceaecf2","year":2022},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:5f8824ec51afd633606bda9ef693c35b214706ccf054396dfd5026de83622396","observation_id":"b018fbbf-9a92-485f-b01d-38de39e39884","resolution":{"observed_at":"2026-05-20T06:33:06.355288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude Opus 4.7","venue":null,"work_id":"ba259d53-1966-4c9a-a662-65922d92b46e","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:41fe25a13c88273692b6f30039e13f2a8de9dbdc7778d74edd87e35ab0bcd01a","observation_id":"dbf85dab-361b-4472-a52f-3fa479283465","resolution":{"observed_at":"2026-05-20T06:33:06.359051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude Sonnet 4.6","venue":null,"work_id":"805ff0b0-98a8-4fc5-aa7e-ba8fb423b81c","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:f07767c13ba1941fabb60354c4495e772376d23a13b3f95513bce1b68e73ecb7","observation_id":"f58ab116-a982-48a2-867b-bdf495e5577d","resolution":{"observed_at":"2026-05-20T06:33:06.374685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:5f6c03cf04d9e5a43c036478c810d98e5330884246ba0dbaf41d00f5fcff2259","observation_id":"8a789041-8fd0-463a-87a5-48ce9809560b","resolution":{"observed_at":"2026-05-20T06:33:05.731646Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.13719","doi":"10.48550/arxiv.2511.13719","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":"arXiv (Cornell University)","work_id":"ceb84861-8bdb-4822-864c-8e2d0ae4d322","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:79097b2c54bad6828b65f4eb38c3cb904fdac080b1ee7705e6955aac8e906581","observation_id":"4231b4db-0387-4bf2-b5ca-bcafb36b1360","resolution":{"observed_at":"2026-05-20T06:33:05.738868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":"2511.16719","doi":"10.48550/arxiv.2511.16719","metadata_source":"pith","pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3: Segment Anything with Concepts","venue":"cs.CV","work_id":"4a72a006-2592-4554-aad0-a9c41a9f952d","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:1cc4126f4d980af76f81ea39b9cea7e40b1967dab289c0c208698c05f9342b11","observation_id":"a0931d2b-9e4a-4d55-90b2-fdb856a52e83","resolution":{"observed_at":"2026-05-20T06:33:05.735281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.687473+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":"92e3805a-abec-4cf2-b3ac-4b9bcdd973b0","year":2020},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:e69591d635c734c2add9bce62074dd99a3ea520c56e680d175c0a9ef88e3694c","observation_id":"c3d88411-23e0-4ded-9057-fc5727cf7f59","resolution":{"observed_at":"2026-05-20T06:33:06.397771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding reasoning and planning","venue":null,"work_id":"cea98620-12f5-4465-a7c6-c36687449521","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:a5fdfd234b799be2f01077698c783324d4dc4dbf6a94f4db06d32c67b49d80c3","observation_id":"d516a63c-5ac9-43a1-8973-23a5153b4a34","resolution":{"observed_at":"2026-05-20T06:33:06.399560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T12:44:53.734066Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models.Advances in Neural Information Processing Systems, 37:135062–135093","venue":null,"work_id":"2d59e7cb-d5c8-46e5-bd0b-7158b959b653","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:f1b17c6023fff9ac4f24c627a4924a6935994d627d81e32f553a5dadbfa1e08e","observation_id":"4df36fd8-41c1-4182-90b6-793b32e47183","resolution":{"observed_at":"2026-05-20T06:33:06.415791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:a215e034ad4e272c6ebdf9981880ee8abbc77554121ebfdfee0624e9e5376760","observation_id":"8beecc7a-8a68-4681-838b-7399bedac2ec","resolution":{"observed_at":"2026-05-20T06:33:05.744553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"6c606667-a3a7-4ba7-bdd7-c1b1885142b2","year":2017},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:deb66c4c9bb1f189a843411bab9fd57a157bcb45ef35a9e1ba3ee07d994f3282","observation_id":"3f26e81f-a39b-49c7-8ca6-929a00667dcf","resolution":{"observed_at":"2026-05-20T06:33:06.403334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSeek-V4.https://www.deepseek.com/","venue":null,"work_id":"87f2953f-53d1-4d0a-a322-a5baaca1bc40","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:81e722acba5fde02f3eb24c83cae7880d1f8f1b7d6188b39f1a599553c20076b","observation_id":"41ef58a2-7630-4b27-8d9f-455db7947792","resolution":{"observed_at":"2026-05-20T06:33:06.380340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":"2505.20279","doi":"10.48550/arxiv.2505.20279","metadata_source":"pith","pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","venue":"cs.CV","work_id":"1b2c1dfb-9d76-4c59-bcfa-8f23e957c138","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:d3c98d41afd0635dae0d4e5d391883ad406d53a18ca3492e684d8a991c940e8b","observation_id":"9a01ac1f-6c16-4883-8bf5-7a95a003cd18","resolution":{"observed_at":"2026-05-20T06:33:05.687991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09848","last_updated":"2025-04-14T03:38:31Z","snapshot_observed_at":"2026-08-16T12:41:30.990282Z","submitted_at":"2025-04-14T03:38:31Z","title":"A Survey of Large Language Model-Powered Spatial Intelligence Across Scales: Advances in Embodied Agents, Smart Cities, and Earth Science","version":1},"cited_work":{"arxiv_id":"2504.09848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.09848","snapshot_observed_at":"2026-07-04T08:59:43.326702Z","title":"A survey of large language model-powered spatial intelli- gence across scales: Advances in embodied agents, smart cities, and earth science","venue":null,"work_id":"40cd022b-9b44-4985-8201-7c466a296383","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2504.09848","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:bfa4649f7517e14000fa47230257a41ff147c5ba46028bba294fea010767e0ea","observation_id":"d61abc35-7a43-4701-9c77-1672ea97cc24","resolution":{"observed_at":"2026-05-20T06:33:05.703873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":"e0f6aa2d-59f9-4086-895c-685c7ed94db4","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:178b5f5d7659b81e47dccef99922ef13cdf3175a9125ffb5b340eba4e595dd20","observation_id":"6741944c-ac64-4752-98e7-08b6811f916c","resolution":{"observed_at":"2026-05-20T06:33:06.367200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T07:20:46.862454Z","title":"Pal: Program-aided language models","venue":null,"work_id":"3e5da501-d2ca-4bec-804c-85eef4857e6f","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:94c7ee0cf9992f74e4a2a1c489ce1b37a185c49fa6c40eb3f676434a892ba7a9","observation_id":"51260352-c3c5-41a2-8eab-777dcc0ae125","resolution":{"observed_at":"2026-05-20T06:33:06.376825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":"01d17ea0-65b3-4f54-ad14-905b3743a03c","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:9d1dd2c9e8ac77ed1d8995f4467b3dfb5b883af019878111b6c0a9c5813f3b0a","observation_id":"16fa4cc2-0d9b-423d-93bb-13a411b84980","resolution":{"observed_at":"2026-05-20T06:33:06.395857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers.Advances in Neural Information Processing Systems, 37:113991–114017","venue":null,"work_id":"e6d92a17-ae0d-4740-9398-b3f19049b08b","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:ff22d0131742d4769359340ffdf34e1e6c3d3365664bd300fb7e3983af4f2e68","observation_id":"464f2f10-5ede-4dac-b5fe-94dc1c7e1222","resolution":{"observed_at":"2026-05-20T06:33:06.411025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":"ba6a5f03-0147-4e08-9be3-b7fb21c663a7","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:9a8cf0d78b6acf12f363de2afa66bddc18471b7de813a13885511649e25b9e6c","observation_id":"fd083deb-647f-4eee-92ea-b034dd64cc69","resolution":{"observed_at":"2026-05-20T06:33:06.365364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:9fc3ac03e0c7b90fb558bbbd12886fc976330e5400a7fab464c6f56f77846f67","observation_id":"0642c3c6-f259-40b0-8616-5db05cd96702","resolution":{"observed_at":"2026-05-20T06:33:05.712873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuro-symbolic data generation for math reasoning.Advances in Neural Information Processing Systems, 37:23488–23515","venue":null,"work_id":"3cb29f59-9cac-415a-9895-34c3cc413014","year":2024},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:aecc4f139b8a96b7a30a5b7e95346fffbaeab4fb2ac164eb012d38d5f1122c7e","observation_id":"f509e4db-a57f-4a80-91bb-6d4cfcef46d7","resolution":{"observed_at":"2026-05-20T06:33:06.363390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916","venue":null,"work_id":"cf87809d-a161-49ac-a7b0-49677b8675be","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:ade9c1c2f983183a4bf6795d43305d2d5d5dd2e58a5155dc391868e2618ada12","observation_id":"3ebddc71-cdaa-4af5-9437-b71b396eb854","resolution":{"observed_at":"2026-05-20T06:33:06.361487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ssr: Enhancing depth perception in vision-language models via rationale-guided spatial reasoning","venue":null,"work_id":"bce861b8-dd2b-40a4-add9-38837b7d0cd6","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:43e287d7ed3d1e5c9ace463014ae615be8dc3295c0b4527d727a04d4795c08f8","observation_id":"07fca96f-014a-437c-84b6-ae87327736e5","resolution":{"observed_at":"2026-05-20T06:33:06.419559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kimi K2.6.https://www.kimi.com/blog/kimi-k2-6","venue":null,"work_id":"02d7ece6-e972-4712-b429-f84aa3ba46e4","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:7d8acefd75ab9f80af57c22857880cb54321313ee8ae27b7f1d9ae350301f066","observation_id":"aede7af8-9d83-46ce-bad5-6683b9f34a5f","resolution":{"observed_at":"2026-05-20T06:33:06.357170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":"2112.09332","doi":"10.48550/arxiv.2112.09332","metadata_source":"pith","pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebGPT: Browser-assisted question-answering with human feedback","venue":"cs.CL","work_id":"e25ef3e1-4848-4cb9-bf28-67a420591165","year":2021},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:8f56e02a68309185524081c9cca0584fc48d6dd1d6e6b0ed2176b697326f9b53","observation_id":"e5cdae1f-dd1b-4ab7-8b57-a9df05839849","resolution":{"observed_at":"2026-05-20T06:33:05.719493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:09.995583+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a9f88e9-6001-443c-bb3b-96ce5dd51c55","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:4704ac89f50287164a1c96e9727be90ca158f2873704b0f3e17647be243239e1","observation_id":"2b31955a-f8a2-47ec-93fd-479d5d088f03","resolution":{"observed_at":"2026-05-20T06:33:06.371191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logic-lm: Empowering large language models with symbolic solvers for faithful logical reasoning","venue":null,"work_id":"1f40d9d7-fc90-4f6f-8e8f-4b93bf3bdc22","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:ce62e0c9de4d4a859a1aa429145a26d1a098cc2a9d5e868e062ab9bcd19e5fec","observation_id":"717405a7-da50-424f-9667-7f76cc25c438","resolution":{"observed_at":"2026-05-20T06:33:06.373033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.IEEE Transactions on Pattern Analysis and Machine Intelligence","venue":null,"work_id":"cf7aa6c3-d6e1-414a-9289-c65374c8173e","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:a10e9f8f2a8467628cc438c3a32616ec06fa2308896103cf3ea34812f7332a2a","observation_id":"98d0cef2-4776-484f-b8a2-85fccda41788","resolution":{"observed_at":"2026-05-20T06:33:06.378698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3.6-Flash","venue":null,"work_id":"24599bcc-71f3-4da0-9f9f-c3ac610386ea","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:c75426afe481253538735f0bd8464d5f0eaca1f67be30d655b77113d0351fafa","observation_id":"83069b3c-c50e-4ca7-8f80-c90187e3cb5b","resolution":{"observed_at":"2026-05-20T06:33:06.405392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-15T11:40:43.216223Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2505.23678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23678","snapshot_observed_at":"2026-07-04T19:20:07.271783Z","title":"Grounded Reinforcement Learning for Visual Reasoning","venue":"cs.CV","work_id":"e7be54cd-0b00-4d24-b74f-56621ab7acd4","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2505.23678","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:d8522b5214b65b7b950b8bc24bf29f7cbe7690861f84a478948b50f7b6a2df26","observation_id":"989ca4d5-d57c-459d-8170-0e9177981012","resolution":{"observed_at":"2026-05-20T06:33:05.700678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seed-2.0-Pro","venue":null,"work_id":"76b03843-9639-4233-a89d-a75001c8b61b","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:e63ac8d474429ef0b32ba44fe7bd2b4184d68a24729c9c49d112af9d7cc0c37b","observation_id":"7d642168-4f02-494c-a833-a484ff0b14c5","resolution":{"observed_at":"2026-05-20T06:33:06.407252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.619961Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face.Advances in Neural Information Processing Systems, 36:38154–38180","venue":null,"work_id":"3f725327-f836-4c9d-a50c-19ffa60c022f","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:18f4b07d77c11ecf002e26dd0abc9b637e58e76618bac968b15ba160c5e1a63c","observation_id":"0b9e7535-b4a5-432d-b23c-bbc92082924a","resolution":{"observed_at":"2026-05-20T06:33:06.413355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08617","last_updated":"2025-07-09T14:53:06Z","snapshot_observed_at":"2026-08-07T19:52:19.808797Z","submitted_at":"2025-05-13T14:35:51Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.08617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08617","snapshot_observed_at":"2026-07-04T20:10:07.295499Z","title":"OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning","venue":"cs.CV","work_id":"3939edf9-d5d5-4c79-bd9c-02e7961fda21","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2505.08617","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:a9fb8a82b967a674c67c5d41246fc60adde7aa741beacf80c445a82b62c16b6d","observation_id":"48c9885d-82e3-4d9b-8623-238a7677be5b","resolution":{"observed_at":"2026-05-20T06:33:05.716648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-16T16:52:49.240000Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":"2506.23918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-11T03:17:51.399835Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","venue":"cs.CV","work_id":"760ebd7d-977d-4280-afae-adb421d49ed4","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:980590cc4f76caf2cdfbbd3b402153672543860c3eb83e4dde63569f40fb53aa","observation_id":"33c71e8f-7213-4dbf-ac02-e8eddbf7b81b","resolution":{"observed_at":"2026-05-20T06:33:05.694300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"0baa14b6-7d4f-4be1-a9ac-592c24261ea6","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:ad7b09ef2a02e37a1555b1c987cc74ddb5ec79e42d0fdc193fe3b7481bf2c16f","observation_id":"17590dce-3ff6-4194-a235-81d871965e58","resolution":{"observed_at":"2026-05-20T06:33:06.388244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09712","last_updated":"2026-04-08T06:28:03Z","snapshot_observed_at":"2026-08-15T03:27:56.745009Z","submitted_at":"2026-04-08T06:28:03Z","title":"LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.09712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.09712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models","venue":"cs.CV","work_id":"635f6872-f2e2-4942-ad38-637f883a40e1","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2604.09712","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:c05682d4d461e85c271bfe1f6fd2adfa7c715aad393941dfe5190f560abc536b","observation_id":"efe77d19-7766-48c6-858b-690ce6dc8aa5","resolution":{"observed_at":"2026-05-20T06:33:05.710072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning.Advances in Neural Information Processing Systems","venue":null,"work_id":"537b5bc1-23a3-4c95-bac5-5f4bac043a1a","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:c460b9f80d856c0e795f3a293d4816108e60a4435d882332d810ed040949e698","observation_id":"12b23ed4-f774-4e6d-b7c9-8ff1d397f9e6","resolution":{"observed_at":"2026-05-20T06:33:06.401468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Last: Learning to think in space and time for generalist vision-language models","venue":null,"work_id":"066b7eec-daa5-446c-b862-9a9522c8f43a","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:5c84bcfdbb1adcfe6f780d628d2a6cf72f96d2ea88bd145eaa71d8ed7251018f","observation_id":"65968de8-2794-4ad3-925d-6d7079370425","resolution":{"observed_at":"2026-05-20T06:33:05.725596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-16T15:07:56.298993Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":"2308.08769","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-07-08T01:44:26.228828Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":"cs.CV","work_id":"9f789861-b3ae-4074-9d4c-9a1f5736e37d","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:322752de48ae8e5bcf2f6eabb85bfdcdece3970289d4bab069ca6e92db7da83c","observation_id":"58c9da7f-4ac8-46cd-a0fb-e43ee5de1961","resolution":{"observed_at":"2026-05-20T06:33:05.691342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:207d12ca9ac3c500dab864633f6f25909cde233d3aeca875de3f56d3266bbf1a","observation_id":"9cbe3419-19ab-4ab9-a1b2-2551a758edba","resolution":{"observed_at":"2026-05-20T06:33:05.707113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial-mllm: Boosting mllm capabilities in visual-based spatial intelligence.Advances in Neural Information Processing Systems","venue":null,"work_id":"11349d34-f76d-4965-b510-e6134c5b437d","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:f8c644f6f9102fe984344f42fada2eedaca795eb3ac82d0fc8879d0a77448460","observation_id":"359663de-b04e-48d5-b469-a1c93fa6e64d","resolution":{"observed_at":"2026-05-20T06:33:06.384334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:11ba854b7dda4bfaded798d4680acd0a30b6741bc2860a5ae6ffc8e2de1cb49d","observation_id":"84b7596f-66be-4b32-8fcd-933260d174e6","resolution":{"observed_at":"2026-05-20T06:33:05.728593Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":"36928888-3479-4a47-b88e-cba27e2f1595","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:a1f985e9eeb6f631de0b77b2da870579e6e077b10656987306ffe6df051f8cb1","observation_id":"9667e7f5-7210-430a-8bee-ac98dc17ba79","resolution":{"observed_at":"2026-05-20T06:33:06.417707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:49:42.516795Z","title":"arXiv:2509.18905 (2025) 6, 9, 17","venue":null,"work_id":"c55c3b64-e350-41a8-a984-776566437b05","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:c7624529bf03a116a4cd0f18af869c9a98f8972b07b4f0122fe8be50a19e0420","observation_id":"78c4f4fa-be29-405c-aef0-63b94960db16","resolution":{"observed_at":"2026-05-20T06:33:05.741795Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the generalization capacities of mllms for spatial intelligence.International Conference on Learning Representations","venue":null,"work_id":"0e1f73bf-ebbb-4954-b49b-332d8d6d8a99","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:678b583fc395328239301dcd8ecac00c38ac28daa3289ebda15cf6dd49ad25cf","observation_id":"a5ed18cd-046a-494d-8671-70d03bf3b99c","resolution":{"observed_at":"2026-05-20T06:33:06.409140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From flatland to space: Teaching vision-language models to perceive and reason in 3d.Advances in Neural Information Processing Systems","venue":null,"work_id":"d69f5193-c0df-4755-b876-5f1dc0f17ccf","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:5d365c709da134c8990d80cc88f75080a08b643a960470f9c3f4b6b72630a683","observation_id":"24e6a5ef-c728-4afd-8b6d-fb7e93100324","resolution":{"observed_at":"2026-05-20T06:33:06.369425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thyme: Think beyond images.International Conference on Learning Representations","venue":null,"work_id":"74211a43-22f4-45c7-b6fd-39ecbbc51109","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:550cbb86f18f69ce11444d9f913a08525e03a346efa8abb019b4eb8a2212f137","observation_id":"3fc31a3f-9c9c-41da-8174-258d9a3343d5","resolution":{"observed_at":"2026-05-20T06:33:06.382236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13029","doi":"10.48550/arxiv.2601.13029","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Think3d: Thinking with space for spatial reasoning","venue":"Open MIND","work_id":"e6dccdbb-b31e-4545-9ce9-686d78d7262c","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:3d591c1f18a4f79c45db3e4e215da8c4576f6a483c58df121cbb856f2adfa033","observation_id":"674fa5ca-92d5-4974-b4eb-1c5e01aec9e1","resolution":{"observed_at":"2026-05-20T06:33:05.697703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from videos for 3d world: Enhancing mllms with 3d vision geometry priors.Advances in Neural Information Processing Systems","venue":null,"work_id":"e047d896-a41f-40fd-b748-80692a2d0ed1","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:7c26761d946c43c1a9bac992081290931bf905401c1c0ddadf38b1a4ea3f875f","observation_id":"75b8135d-50bf-4af4-af68-eec2164ce0a2","resolution":{"observed_at":"2026-05-20T06:33:06.390191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"236ba3ef-e61a-4a05-925a-ab2ebc128208","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:509848cb6a6d5d3b9b2366a537dbeffe89bd4e6dd2cd0b6a757b9167dda5af43","observation_id":"4061159a-c108-4a67-831a-a54657811161","resolution":{"observed_at":"2026-05-20T06:33:06.386406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"thinking with images","venue":null,"work_id":"c99aa6ca-4317-4846-bcea-de7853c6b596","year":2026},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:63c9a0640177df8818631bdbfef8aca50d28865369b082535894861fbcab1a33","observation_id":"4bd15e3c-f212-4fe4-b767-5bd536ac8bf9","resolution":{"observed_at":"2026-05-20T06:33:06.391842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Roborefer: Towards spatial referring with reasoning in vision- language models for robotics.Advances in Neural Information Processing Systems","venue":null,"work_id":"ed98cf57-fc0d-4b0d-9c5e-577cba71687e","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:61af86c773d51d0dc7c18d3501a3553a3033123586be459b6054c598a0f91ad7","observation_id":"6da640a0-7c45-405c-8d7c-037d84899326","resolution":{"observed_at":"2026-05-20T06:33:06.393740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-16T02:02:56.335890Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"cited_work":{"arxiv_id":"2509.01656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01656","snapshot_observed_at":"2026-07-10T07:36:57.995051Z","title":"Reinforced visual perception with tools","venue":"cs.CV","work_id":"4b06b3fa-508d-4153-ae9a-da6c80291228","year":2025},"citing_paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T06:31:04.432486Z"},"links":{"cited_paper":"/paper/2509.01656","citing_paper":"/paper/2605.19528"},"observation_digest":"sha256:2cec7ea205c0f548892ac3dd6c4b40941967eedecc46a295985ac816c346bb17","observation_id":"3b664314-82e5-4238-843b-8a7b39bcb08b","resolution":{"observed_at":"2026-05-20T06:33:05.722823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19528","last_updated":"2026-05-19T08:30:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T14:44:38.782940Z","submitted_at":"2026-05-19T08:30:21Z","title":"Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":18,"verified_fuzzy":33},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2605.19528."}