{"as_of":"2026-08-14T06:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60dbb423edf05122095b5a5c4bca7203847c9bb413f88be23b0b504842cb2f3b","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T21:32:52.151978Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.12586/citation-record","integrity":"/paper/2605.12586/integrity","json":"/paper/2605.12586/citation-record.json","paper":"/paper/2605.12586"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.09954","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T15:38:33.105444Z","title":"The spatial blindspot of vision-language models.arXiv preprint arXiv:2601.09954","venue":null,"work_id":"3bba1383-654b-4e46-ac5c-0314aa8b8e5e","year":2026},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:2c732924fb069fbe46c6e490763e5a355f1b3e6478467470787adfb500aa94e1","observation_id":"29923a26-1915-402c-9687-486c095ff4dd","resolution":{"observed_at":"2026-05-14T21:32:58.971089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":"2108.07732","doi":"10.1007/s11390-025-5518-5","metadata_source":"pith","pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Program Synthesis with Large Language Models","venue":"cs.PL","work_id":"fd241a05-03b9-4de2-9588-9d77ce176125","year":2021},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:0f9cf544a7276c1226b26fa5c1867ebb27200cdc67cf2228ef6eeb7f84df5b8a","observation_id":"88bb82c5-b168-4f3c-851e-13051a645db3","resolution":{"observed_at":"2026-05-14T21:32:59.011813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:9cf1a9379f5e75ca07b68c35b4e8e7c86d2f6e03cb413e3f76a91e8f0cd71ccb","observation_id":"ddaba844-5d0e-4118-92c3-703ae95b5d4e","resolution":{"observed_at":"2026-05-14T21:32:58.984612Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.01773","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:39:37.674682Z","title":"Why is spatial reasoning hard for vlms? an attention mechanism perspective on focus areas","venue":null,"work_id":"cb9bb652-e52c-4ea5-9f44-b1c3342e7c5c","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:39d482e5a06922e2d03a8ee9d933e7ddf33b4451705ee05f2d1f8131a8fe4066","observation_id":"6ce0409e-659a-400d-a9b0-c2e9eeda9b7e","resolution":{"observed_at":"2026-05-14T21:32:58.976091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-12T14:56:35.025839Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:7bc245bde38f76f6abe60e326ee4c414d759fb5539155bc266f490d36ae62192","observation_id":"6e819d70-b53c-4a08-a7e8-fd370f09b088","resolution":{"observed_at":"2026-05-14T21:32:58.966580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.12626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T09:35:41.058794Z","title":"Linear mechanisms for spa- tiotemporal reasoning in vision language models.arXiv preprint arXiv:2601.12626","venue":null,"work_id":"90de4c0a-88ef-4a8f-b2fc-4a94864f4949","year":2026},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:1e36d7cbeb82cf3c1895e441ebf494514723590ff84487044c5f826a1f88e135","observation_id":"3919e01c-597e-449d-8440-06452b2dcc1b","resolution":{"observed_at":"2026-05-14T21:32:58.989163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08531","doi":"10.48550/arxiv.2510.08531","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llava-st: A multimodal large language model for fine-grained spatial-temporal understanding","venue":"ArXiv.org","work_id":"321e17e5-7b25-418a-bf50-f5fb5559000e","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:00147f00d4b6c820e3bc81bbfe51dfbe5874b0e30dca0825951ae0a5115aee01","observation_id":"8251b0b6-aeef-4f99-8a9e-9ef63a733bc7","resolution":{"observed_at":"2026-05-14T21:32:58.980495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:f48b976450780772454fc174726e338d4a2753aa59db0530edf25a60232bab45","observation_id":"d3bef577-88ac-470e-aec5-a1f658d10457","resolution":{"observed_at":"2026-05-14T21:32:58.993340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.17349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:27:30.257312Z","title":"Beyond semantics: Rediscovering spatial awareness in vision-language models","venue":null,"work_id":"c661cee3-78d3-4e40-8755-e8221cb6aac7","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:7c2ca6e74a0bb9c789f920164fb189faa693d01141c5fe3e9ab5374a39a9fd4d","observation_id":"5718c137-5411-46f9-aa94-662b9553a17e","resolution":{"observed_at":"2026-05-14T21:32:59.007937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design2code: Benchmarking multimodal code generation for automated front-end engineering","venue":null,"work_id":"bf5c267f-ba9e-4206-8d08-a8697216e378","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:95f1c15615fcfb8b5caa5ad8ee952785bca9a1c3d97cd8c5ab532a7c1de76217","observation_id":"85ec4c39-6a78-462e-ba08-a55bebc4d37c","resolution":{"observed_at":"2026-05-14T21:33:00.156018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"cited_work":{"arxiv_id":"2511.21471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21471","snapshot_observed_at":"2026-07-04T08:59:43.334805Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","venue":"cs.AI","work_id":"81942f57-c90d-41fc-9036-779f35d52bed","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2511.21471","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:31886bef21f4df9ee4f0f1a4c8a82ad455fcb028fcfe42e5acfb0cea75a26cd1","observation_id":"b26cd689-e332-4ab7-b3b7-eb13164ff188","resolution":{"observed_at":"2026-05-14T21:32:58.996935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:1a2f192d5a4144492c512cdd94c6a76a73f009744eea9ae26d2060c73404fda5","observation_id":"22ac36c4-05e4-483a-a7f6-901f8403ec98","resolution":{"observed_at":"2026-05-14T21:32:58.961463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"scene_id","venue":null,"work_id":"d82cc0d3-4a25-4f7e-b647-21f3365d1a65","year":2025},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:bd5ec1b62d50804cedc9cadf43d2ffaecc4caf03fb4931017bc309cdbeadc773","observation_id":"420c7853-ffb1-46d8-bd5a-dca623eecb9d","resolution":{"observed_at":"2026-05-14T21:33:00.159014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"best_cc /worst_cc use each model’s primitive-best / primitive-worst scene-code language from Table 1.∆best-direct = best_cc−direct(pp)","venue":null,"work_id":"914ac3b7-9530-4e84-a3aa-0f531bb35f51","year":2024},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:d74b5a1c50518bb0731642830a9c9ccb8a8452f84929fabba798315909531f37","observation_id":"53b51ad9-1b5b-46ad-a946-946cf8570ae0","resolution":{"observed_at":"2026-05-14T21:33:00.145737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"single-view S3-FT lifts SpatialBabel-QA by ∼+7% averaged across modes on Qwen3-VL-8B","venue":null,"work_id":"a62222e6-ee8d-4d01-86a2-a8b15e31bab5","year":2023},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:6f729642cb7015e77d2e1e69d5afbe8e4d5d23d6cbb094169533db6df8274e15","observation_id":"05425b58-f0fc-4d3f-b2ce-6a9a31f3ae01","resolution":{"observed_at":"2026-05-14T21:33:00.149167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pass rates: Qwen3-VL-8B 82%, Qwen2.5-VL-7B 84%","venue":null,"work_id":"b21632d4-31dd-45b9-862c-5b3e43a9b619","year":2048},"citing_paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T21:32:52.151978Z"},"links":{"citing_paper":"/paper/2605.12586"},"observation_digest":"sha256:1c7b095cb8b9ef68cb4a2ebffb3f6077650a9361b6dfd64a148065ea8ca62a17","observation_id":"3e247290-6e19-4148-894d-e046f4108f84","resolution":{"observed_at":"2026-05-14T21:33:00.152345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12586","last_updated":"2026-05-12T17:57:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:53:16.340569Z","submitted_at":"2026-05-12T17:57:21Z","title":"3D Primitives are a Spatial Language for VLMs"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":5},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2605.12586."}