{"as_of":"2026-08-17T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:99ec4825a5d223f91ad7f4c61ec4e6b2902ce5c4595203b67d7864c410ac8fd9","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:40:27.818667Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:42:12.968388Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00788","snapshot_observed_at":"2026-08-03T18:42:12.968388Z","title":"Spatialllm: A compound 3d-informed design towards spatially-intelligent large multimodal models.arXiv preprint arXiv:2505.00788, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-15T03:31:37.338569Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:42:12.968388Z"},"links":{"cited_paper":"/paper/2505.00788","citing_paper":"/paper/2512.04069"},"observation_digest":"sha256:e3cc14e1ba165f1573cef3191cd4d3a235b2845a0ef3057ac174a13cfa77f47b","observation_id":"2eeb54c1-f742-4702-aacc-667cb7965203","resolution":{"observed_at":"2026-08-03T18:42:12.968388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.00788/citation-record","integrity":"/paper/2505.00788/integrity","json":"/paper/2505.00788/citation-record.json","paper":"/paper/2505.00788"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T03:30:12.735656Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T04:40:27.528694Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.528694Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:76528234bc094e326612f54da88ae806a2da814db10b1c975394084c5231398d","observation_id":"406a59fe-1e26-4614-8284-1220506dbdf7","resolution":{"observed_at":"2026-08-16T04:40:27.528694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.710452Z","title":"SpaceLLaV A.https://huggingface","venue":null,"work_id":"9d4b04dd-1b22-4e1c-96fe-edcd0e924099","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.533093Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:f49fa15eb6e3387afcd6a60a0f2e65956688cf1fcd9199c60c3a6ad8afa2523e","observation_id":"3899654e-51cf-4047-8147-8fc65620184d","resolution":{"observed_at":"2026-08-16T04:40:28.715270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.537060Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.537060Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:ccd6bfe13039d7fbf8e17b4a7bbfca040fe81d055c62da344882d39d9c47b186","observation_id":"ef159a4d-37d4-4506-bfd3-d6e4a9577b20","resolution":{"observed_at":"2026-08-16T04:40:27.537060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.686903Z","title":"Claude 3.5 Sonnet.https : / / www","venue":null,"work_id":"f1970b31-ec9a-49b2-9706-4dfe56fe6979","year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.540724Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:20c2c8cbd86472d952b980358a070b336ebf785b82e1e7c7f81e4e38917abe5d","observation_id":"54101c4c-4803-4e16-8d9f-cd5527539fa6","resolution":{"observed_at":"2026-08-16T04:40:28.691472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.672087Z","title":"Apollo syntheic dataset, 2019","venue":null,"work_id":"df5d5ae5-87ea-4f49-9047-9594c87e482f","year":2019},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.544404Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:75398f3274e2f1935aa87a6de2547210d585b9dbcc3420b94a5faa7b5832c714","observation_id":"d08d78bf-58cd-48f3-a510-6f425e17e097","resolution":{"observed_at":"2026-08-16T04:40:28.676342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.658790Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"f3f4c095-7ac1-48ef-8d45-9e6800551767","year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.548786Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:21daa0d168f6fa5c66f90b3f654abb315c5a5593a3111ac780c0c0e3bcea071f","observation_id":"1c09667c-7bfd-433e-beed-de79b75fe683","resolution":{"observed_at":"2026-08-16T04:40:28.662827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T04:40:27.553190Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.553190Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2b4e498bd25c3719f217fcf6b372869a02be7edffa81a8b3d9336a34bfb6a4c2","observation_id":"b680ca9b-60bc-408e-b398-2ded5eba2dc2","resolution":{"observed_at":"2026-08-16T04:40:27.553190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T04:40:27.557935Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.557935Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d8bb79eafc8022f7857ff41411d684f35b9a3804709f40b4edf384545a95bad4","observation_id":"210bf3bf-22e8-47c5-928b-c18b4892d11b","resolution":{"observed_at":"2026-08-16T04:40:27.557935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-16T04:40:27.563585Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.563585Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7b5075af98adaa5c4db2315c39737da6dad1d417a3d56315db0672959be47ca3","observation_id":"014d3939-6660-4473-93c9-d6dac68e29ea","resolution":{"observed_at":"2026-08-16T04:40:27.563585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-16T04:40:27.568854Z","title":"Zoedepth: Zero-shot trans- fer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.568854Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2c42cd5b1a34326ff6c3acaa356f8cec72e5c53b248dbf8d43878c64ab0182a8","observation_id":"2379b6d3-b0e9-4702-8586-5485bee21225","resolution":{"observed_at":"2026-08-16T04:40:27.568854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.644139Z","title":"Omni3D: A large benchmark and model for 3D object detection in the wild","venue":null,"work_id":"fd206eff-0796-4d27-8174-f841bc1dc66d","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.573588Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e60b3c908d00d2171586c69b56e8cdab37dc09896ffee4be42854c11a728448e","observation_id":"bdcc0a7c-ab19-42be-8fca-2fcc0b0824dc","resolution":{"observed_at":"2026-08-16T04:40:28.649771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.630409Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"f6a9eeda-8858-4621-9cfe-8c3c0d551c17","year":2020},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.577671Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:3f45a27857b9f8f692fbbee7e08a5cae08a723812f80cf5f8cef3cb374091a95","observation_id":"f7518ae4-2fea-4820-9626-77596264aef2","resolution":{"observed_at":"2026-08-16T04:40:28.634820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.616551Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"5f39970a-b605-4e99-97e4-8c82349bca4b","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.581845Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:b26dce8527f5fe995f01f913eb9e350204c47127c0153ee4b6aa2d2c55e89f24","observation_id":"b3b2ee18-f9ae-4442-b275-15616a4374b7","resolution":{"observed_at":"2026-08-16T04:40:28.621016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.586160Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.586160Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9bf698fd7357c5e7f4c7a1d8198909ef4b77513ed885876bae303c1646ee00f5","observation_id":"6613005b-fd73-4555-b321-9c286ba2a0c4","resolution":{"observed_at":"2026-08-16T04:40:27.586160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.593504Z","title":"Vitamin: Designing scalable vision models in the vision-language era","venue":null,"work_id":"dbc5f2b0-1095-434e-8ba8-8c9e22f58ea8","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.590245Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e7ebb4e2ae20856b5b24f885d86986ab33e8796f9390b43f66d18b2b0cbee420","observation_id":"bb75f2f4-66a5-4a0d-b871-a3b9d668f78a","resolution":{"observed_at":"2026-08-16T04:40:28.598273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01584","last_updated":"2024-10-15T01:16:20Z","snapshot_observed_at":"2026-08-16T13:46:36.421633Z","submitted_at":"2024-06-03T17:59:06Z","title":"SpatialRGPT: Grounded Spatial Reasoning in Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01584","snapshot_observed_at":"2026-08-16T04:40:27.594324Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.594324Z"},"links":{"cited_paper":"/paper/2406.01584","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:4afbac1ab5625a877803a9c371bdb03b3d274ddeae8efaf1334cffb71b28bee1","observation_id":"ee237961-8d51-49cb-87d3-00b205a249fb","resolution":{"observed_at":"2026-08-16T04:40:27.594324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.579661Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"cb826255-54e0-4f39-b6d1-92f8c32cb1bb","year":2009},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.598798Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:63731034329bfdbdc78cef9452903898a28323c08be6868eed1060ad00650dbb","observation_id":"c7428130-25d9-401f-b0f8-ff71c63dfd4e","resolution":{"observed_at":"2026-08-16T04:40:28.584277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T04:40:27.602876Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.602876Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d186ba999acad0b4df001176d0a1149e49acf10a7b2438ac879d661d0b95fa7e","observation_id":"e2fe4363-1272-494e-bdbc-866bceb42454","resolution":{"observed_at":"2026-08-16T04:40:27.602876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.567400Z","title":"Prob- ing the 3d awareness of visual foundation models","venue":null,"work_id":"d4afe88b-52b6-471e-91c1-6b87eec30298","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.607343Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d695b584750ba45e685f3f0206a33a4ec7b3ec8d993e9d3969bd314e8dc7dbab","observation_id":"8f4a9e3c-3739-4cf3-b85d-a0bcc6ded7c3","resolution":{"observed_at":"2026-08-16T04:40:28.571158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14108","last_updated":"2023-10-20T17:01:44Z","snapshot_observed_at":"2026-08-16T15:37:17.617814Z","submitted_at":"2023-04-27T11:37:18Z","title":"DataComp: In search of the next generation of multimodal datasets","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14108","snapshot_observed_at":"2026-08-16T04:40:27.611469Z","title":"Dat- acomp: In search of the next generation of multimodal datasets.arXiv preprint arXiv:2304.14108, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.611469Z"},"links":{"cited_paper":"/paper/2304.14108","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:44e64b10efea7c73b5d987ba16bc1a2b882fa58781c7a4777a8478156b95c996","observation_id":"01858a9a-0c1a-4c10-9b5b-b5316d65ceee","resolution":{"observed_at":"2026-08-16T04:40:27.611469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.553792Z","title":"Are we ready for autonomous driving? the kitti vision benchmark suite","venue":null,"work_id":"12a81517-0c0c-4070-a7a9-85102f86ed73","year":2012},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.615737Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:abde6a3a663d500d851d8cfcca2e4b9c6e086a17f298d515a072f6179e8049e3","observation_id":"bf252cec-806e-40cb-bddd-14c085680d2c","resolution":{"observed_at":"2026-08-16T04:40:28.558228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.619809Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.619809Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:c5718b91804bc8b0939a640c9dcca0a1b6c10df945e04879f162d12b9911b270","observation_id":"963710cf-9f38-43ac-9697-a4faa7d1eb9a","resolution":{"observed_at":"2026-08-16T04:40:27.619809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.531316Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"15afee93-aa25-4da5-9c5f-8fd429d5dbe5","year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.624025Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:106da55386f8448eecbd27ec3c83ee3de5f77b60664f9e0c7429bf3721e1ceb0","observation_id":"5853c801-4a09-4244-a610-be3722600d4d","resolution":{"observed_at":"2026-08-16T04:40:28.535650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-16T04:40:27.628147Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.628147Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7d0159e7b97c8b4a85cf730000dd386eecc0357a88df104ceb1e69786d8edd45","observation_id":"0bb241a8-9b5a-49e6-a74c-b4964909fd04","resolution":{"observed_at":"2026-08-16T04:40:27.628147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.632345Z","title":"Open- clip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.632345Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e25aff65b49b69d779a48a3c2780b14f3fe247d407b1797a1f8c87f9b8651304","observation_id":"ab3e944d-9ffc-41be-8881-0afa42753c6a","resolution":{"observed_at":"2026-08-16T04:40:27.632345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.636714Z","title":"Novum: Neural object volumes for robust object classification","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.636714Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7b55bc766f72679ac40f15ac462105426d6f837f6dc60ac748c487e6fcb67756","observation_id":"efad3a13-2355-4f59-857a-bcf21ed9e00d","resolution":{"observed_at":"2026-08-16T04:40:27.636714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.641122Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.641122Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:972296b6c72f73c51dc72ddf9f4df01a55843ca79fd0116606e4b00fa258eff5","observation_id":"0a18a1e3-b8c5-4f12-919f-d9372cfeb9b4","resolution":{"observed_at":"2026-08-16T04:40:27.641122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T04:40:27.645314Z","title":"Mistral 7b.arXiv preprint arXiv:2310.06825, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.645314Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:86d0d05f49ad987d9b4c11cacde25f8f19d1706fc67d259610c1b957b56578a2","observation_id":"8b70a587-e6b4-442f-a52b-039d3219ebb4","resolution":{"observed_at":"2026-08-16T04:40:27.645314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.492354Z","title":"Perspective fields for single image cam- era calibration","venue":null,"work_id":"ab481b11-f21e-4393-a0f8-d4c4e12e8726","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.650512Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:fb4c3507e320e0d08c727a1ce2f0487d07fbdbb8277baf2338adffda68c2ee55","observation_id":"23def1e4-6e16-456d-a272-19374143cbe0","resolution":{"observed_at":"2026-08-16T04:40:28.496761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-16T04:40:27.654030Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.654030Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:30bbe624bedd385318eee75e5187fae15ae60426514937b20d80654ce4b7819d","observation_id":"0f29b4b2-cd60-4d8a-bccf-fe8980c20c1c","resolution":{"observed_at":"2026-08-16T04:40:27.654030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.478353Z","title":"Segment any- thing","venue":null,"work_id":"489fb219-1f68-4129-8705-d7915d53d196","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.657739Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:cdd8272d015fef6fd07df443ebf71e07b1d1c8340832e29fade8808da69f576d","observation_id":"d6ad7280-ab4e-4084-8836-82d3c4087e82","resolution":{"observed_at":"2026-08-16T04:40:28.482808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.464050Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"1469a149-35e4-4e12-a560-24e1482ca1d9","year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.661340Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:620c05e407294365087920f6b218d4e0064cf17565e1f8bc52a792e441c3324a","observation_id":"e8503dba-ab6d-41a7-ba90-27a7802de402","resolution":{"observed_at":"2026-08-16T04:40:28.468752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.451385Z","title":null,"venue":null,"work_id":"008aa06a-4f3d-4fc0-ad07-3b8da5ac585c","year":1956},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.664986Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:6a7de45b160b9404b6073a9417c27e8b7a37c7f7317fcc4327645191d807b9a8","observation_id":"6133f4d5-e8dc-43b8-b982-5d7bc1ba9234","resolution":{"observed_at":"2026-08-16T04:40:28.455596Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T04:40:27.668620Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.668620Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:aa752c972f54a340ae229a3b1f835deea02a172e2b34292d39a41bcc6278c4e6","observation_id":"ec3d869b-35a5-4bf8-a173-9680cbc1cfd0","resolution":{"observed_at":"2026-08-16T04:40:27.668620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.672593Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.672593Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:999628bb0b0b9a7360ba17c28068301b34a76a7c3bdda5eb48d10de4975e22f7","observation_id":"da067013-52b3-4923-b835-b331d5dff1cf","resolution":{"observed_at":"2026-08-16T04:40:27.672593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.676116Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.676116Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:573975d4fc34babc55a75489771f567e8bfaba10c44bf06934fb2158014f4a5e","observation_id":"6a9eeaed-3940-4f5e-bf21-6cac2194feff","resolution":{"observed_at":"2026-08-16T04:40:27.676116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-16T04:40:27.679528Z","title":"What if we recaption billions of web images with llama-3?arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.679528Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:15ca8fae9ec36abc52d9d762a35317267d617161b955dea401e21a748a395276","observation_id":"e191db48-ad61-4223-9dab-3e802c457a8f","resolution":{"observed_at":"2026-08-16T04:40:27.679528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.420221Z","title":"Learning customized visual models with retrieval-augmented knowledge","venue":null,"work_id":"9e851753-a52c-4ae9-ba3d-6b136e4591b2","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.683992Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5d054409c593567f144ed059df4ca9ce806002bc773d4f7bee4acb575b3d5b5c","observation_id":"2d8537d9-59b3-4597-bf88-eb1310a983ab","resolution":{"observed_at":"2026-08-16T04:40:28.424103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.407350Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"8139e63f-4867-4eab-9c04-a43b301fe808","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.688146Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5b510f6fcdfd416ab7186ea2410f86ffbd23a4cd1e18aa022ca48c4d084fcd99","observation_id":"b5370f09-d4d9-4e65-823c-dd477f4ebdd9","resolution":{"observed_at":"2026-08-16T04:40:28.411147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.692491Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.692491Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:38b44c791a693a918e282e7766a275b177841a075cdc104d0b6e3a7aee1f5c46","observation_id":"8563a318-bdce-4f59-94e2-8c66228b8f8b","resolution":{"observed_at":"2026-08-16T04:40:27.692491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.385223Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":"3644e9fe-6f86-4da1-99f0-8eb894ced432","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.696559Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:07ddf7b83482c628a691a2cec57809ca6e198f417f89f41c19ff90a9a73e777c","observation_id":"9078385e-9047-431d-88a5-8539b76bdac5","resolution":{"observed_at":"2026-08-16T04:40:28.389689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-16T04:40:27.701110Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.701110Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:3bf06d31a7816f1e43190c28484b7459a6c70643ec30ac337efd50966749efc1","observation_id":"2d40ee3a-6590-4210-971b-7cb5e430e012","resolution":{"observed_at":"2026-08-16T04:40:27.701110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-16T04:40:27.706213Z","title":"Deepseek-vl: towards real-world vision- language understanding.arXiv preprint arXiv:2403.05525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.706213Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:99405dfbf03563bf069865ed7bc269860c64ce9959abe6c70586efbc6e523455","observation_id":"1b4f0ab1-d640-46cc-b582-d973fb3af87f","resolution":{"observed_at":"2026-08-16T04:40:27.706213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.710906Z","title":"Robust category-level 6d pose estimation with coarse-to-fine rendering of neural features","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.710906Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:7750a4c1369fddba1b88cadfc922fe2bf19aa43beb4135ee84b7c50f8952cebc","observation_id":"9d41879e-6ea7-45c5-9dd6-5fb92975967a","resolution":{"observed_at":"2026-08-16T04:40:27.710906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.363074Z","title":"Imagenet3d: Towards general-purpose object-level 3d understanding","venue":null,"work_id":"7ef7e6fa-8f47-4cbe-80df-448816352008","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.715210Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:45c152153f1769c26c02bdb957b37377352d79f31425564f01b2bc686a9ddf2a","observation_id":"cb3e3658-1c82-496c-8a94-595420f171ad","resolution":{"observed_at":"2026-08-16T04:40:28.367631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-16T04:40:27.719431Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training.arXiv preprint arXiv:2403.09611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.719431Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:a8ce9828ac4b1aa2433db069bb29352a325d3c607dd2f8297108fa0ab9661c3e","observation_id":"ee39a5d8-b409-4f20-afb8-66877bafd94d","resolution":{"observed_at":"2026-08-16T04:40:27.719431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.349292Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":"c0a1ea46-bd6b-4f62-b3e8-263a77100fd2","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.723958Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:bba1f46da3e314e5e2cfe733f4dd3f11cd6fc67cadc5d0fd3120c649c8a9144d","observation_id":"a0f212ba-c183-4ba0-ac22-e03927a53aff","resolution":{"observed_at":"2026-08-16T04:40:28.353857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.335991Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"85647d46-7ed8-445c-bfa9-e35605884cee","year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.728221Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:feed95ca26c53ce8e98a3e36f9497237e666d3fd31c52539db9959b36e76f811","observation_id":"46c97bf3-ed26-462e-8532-8f29b56a2c81","resolution":{"observed_at":"2026-08-16T04:40:28.340434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13246","last_updated":"2024-10-10T22:22:52Z","snapshot_observed_at":"2026-08-16T13:41:35.302169Z","submitted_at":"2024-06-19T06:15:26Z","title":"GSR-BENCH: A Benchmark for Grounded Spatial Reasoning Evaluation via Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13246","snapshot_observed_at":"2026-08-16T04:40:27.732388Z","title":"Gsr-bench: A benchmark for grounded spatial reasoning evaluation via multimodal llms.arXiv preprint arXiv:2406.13246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.732388Z"},"links":{"cited_paper":"/paper/2406.13246","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:6f7a6d1181b817064a2aa22601f0ecbf0b9ec1e39c266b90aacbf32cd49edef9","observation_id":"ab98a02a-21ff-4a25-aa69-358024560e93","resolution":{"observed_at":"2026-08-16T04:40:27.732388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.737271Z","title":"Susskind","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.737271Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5c83a9c689c7f837cd6b039dd3f6eb3cc6c58f4c8777a9f05383587046ec1267","observation_id":"5ce633a1-7150-4fe4-b5d2-0c05685ba58f","resolution":{"observed_at":"2026-08-16T04:40:27.737271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.742087Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.742087Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d543a6974e78efd417ce85e11a703e1ce03d02935bfaebd679de6fbbb4c37481","observation_id":"0480b152-9d4f-456f-8a1f-4cf1911f0bd2","resolution":{"observed_at":"2026-08-16T04:40:27.742087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.746271Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural In- formation Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.746271Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:0bdb15f2305a77de3d0983c5b3e0ffa45ac56813d75cd98cf107f995ccfe3c66","observation_id":"006893b9-ae58-480a-858a-34eae99b0e66","resolution":{"observed_at":"2026-08-16T04:40:27.746271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.750251Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.750251Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:4aa297c29c808464e3cbb5fda5c43a73bf613d2f07794ba66ed8c1ddb31f61b6","observation_id":"d9eed4e5-c451-414b-9f1c-d369abc0d3cf","resolution":{"observed_at":"2026-08-16T04:40:27.750251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.288560Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":"68fc3605-5ff8-47b2-877e-79712d869788","year":2015},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.754431Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:f207523883217f18ec11f584971a422250e0ce06526429d0259d759c8acfe6e3","observation_id":"38d7f83c-8884-48a2-a43a-5028083c44e9","resolution":{"observed_at":"2026-08-16T04:40:28.292913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.274903Z","title":"Core knowl- edge.Developmental science, 10(1):89–96, 2007","venue":null,"work_id":"8c32706c-cb2a-4b9f-af40-0ecb154f8dec","year":2007},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.758501Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:21b14e337349911e72ee54466bae2d436e78c51812ee115d65c98d30c5b7737d","observation_id":"5079e0ca-85ec-40d6-8dd8-fc7220e45669","resolution":{"observed_at":"2026-08-16T04:40:28.279345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.261719Z","title":"Revisiting unreasonable effectiveness of data in deep learning era","venue":null,"work_id":"d6741fd6-4a8e-4d7c-93ff-1084932a1151","year":2017},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.762558Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:e8a97e7d88516adca4c265d4340f20449041fd7ac1ba344d66f2c267f3a59ac2","observation_id":"2d34e57a-31d7-4600-b65c-438238908d63","resolution":{"observed_at":"2026-08-16T04:40:28.266026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T04:40:27.766525Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.766525Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:89d32ef81845a78dd2145e7c8285bdaf1fcd03575c9ba2e15d99f6f308c64d21","observation_id":"136a0093-736c-4ee3-81e0-c392bb18cacf","resolution":{"observed_at":"2026-08-16T04:40:27.766525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-15T07:01:36.213052Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-16T04:40:27.770707Z","title":"Cambrian- 1: A fully open, vision-centric exploration of multimodal llms.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.770707Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:83afff03422f1d0d72ba9c366b9618a08e13cd6c4672dcde3c21709c8075c777","observation_id":"7432001d-b856-4980-8200-07a6a7a57b7b","resolution":{"observed_at":"2026-08-16T04:40:27.770707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T04:40:27.775308Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.775308Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:364d18696b3960d92c7c8e128f536a1eea429c198f1bd9ea70a6999ece63aa11","observation_id":"58112f68-ab1b-4fd0-9de8-9a674ab0493b","resolution":{"observed_at":"2026-08-16T04:40:27.775308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.247713Z","title":"3d-aware visual question answering about parts, poses and occlusions.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"3118ff8f-eaf1-4266-91cd-80554954491e","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.779103Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:5db08e4ecf7af771867abeab79f77408c8804d273c05d1dc42491bda83f0a0af","observation_id":"1cb36f74-af69-48b2-b64b-007267717ddc","resolution":{"observed_at":"2026-08-16T04:40:28.252560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00622","last_updated":"2025-04-23T04:53:40Z","snapshot_observed_at":"2026-08-16T13:47:04.311021Z","submitted_at":"2024-06-02T05:51:15Z","title":"Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00622","snapshot_observed_at":"2026-08-16T04:40:27.782481Z","title":"Compositional 4d dynamic scenes understanding with physics priors for video question answering.arXiv preprint arXiv:2406.00622, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.782481Z"},"links":{"cited_paper":"/paper/2406.00622","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:4b75401198466537893ca90b32e76da31fb3992b1e4f0ad085f2213bcc9bccd7","observation_id":"87ad28bf-6065-4e22-a3aa-3ad93f02c52b","resolution":{"observed_at":"2026-08-16T04:40:27.782481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.786283Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.786283Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:4757fd8059dd841c8d8b69278b1d1de13a541b91942bb448a651524d93d217e4","observation_id":"9413468e-6207-41cb-a66c-0ba8a4f1ed2b","resolution":{"observed_at":"2026-08-16T04:40:27.786283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:27.789631Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.789631Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9758e5216f0c9862628dcef118eb2561862913662bd079fc3d665751a4949155","observation_id":"5bcdd412-64c8-4b6c-bae0-b479654111c3","resolution":{"observed_at":"2026-08-16T04:40:27.789631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08359","last_updated":"2022-11-29T01:51:28Z","snapshot_observed_at":"2026-08-16T17:34:20.104698Z","submitted_at":"2021-12-15T18:59:59Z","title":"3D Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08359","snapshot_observed_at":"2026-08-16T04:40:27.793012Z","title":"3d question answering.arXiv preprint arXiv:2112.08359,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.793012Z"},"links":{"cited_paper":"/paper/2112.08359","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2cd0a22e5bcac74585529b34314fab605e973abaecb43cc62c12de43e4f8c4a0","observation_id":"641aa501-4832-4c54-a095-8c145200b324","resolution":{"observed_at":"2026-08-16T04:40:27.793012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-16T04:40:27.796715Z","title":"Coca: Contrastive captioners are image-text foundation models.arXiv preprint arXiv:2205.01917, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.796715Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:269431f02b3ac551021e5bcdbd210cb3fae59100bc9c75951e826d85f5129c2a","observation_id":"0a28dadf-2403-4a41-b966-8c54e4654bec","resolution":{"observed_at":"2026-08-16T04:40:27.796715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-16T15:26:15.090405Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-16T04:40:27.800978Z","title":"Recognize anything: A strong image tagging model.arXiv preprint arXiv:2306.03514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.800978Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:0c9762830c959d091564fde69b234e8088cfabd1161c991d83248f8a4ce83f44","observation_id":"c0976f13-42b8-4a8e-b0c9-79e2abede03f","resolution":{"observed_at":"2026-08-16T04:40:27.800978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.219310Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":"15cf70d8-6430-47b2-8764-2feb049a5321","year":2024},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.805680Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:9223002c7ba9d706237f6e2ab3d6ab30315476b9dbf093d762c416c12a3c5ea8","observation_id":"05828b61-7e53-4419-969c-22fdbc6382e6","resolution":{"observed_at":"2026-08-16T04:40:28.222985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.206010Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":"f686e783-2e6a-4a4f-ac0a-f1c2cb9d3e44","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.809925Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:c8502af312a4ca7827fbe25b5eac5bd93e189848eba2a3604362895f84d75ed2","observation_id":"c6ea85e2-6324-4c84-89cb-3e5cc5a09a3b","resolution":{"observed_at":"2026-08-16T04:40:28.210551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-16T04:40:27.814069Z","title":"ibot: Image bert pre-training with online tokenizer.arXiv preprint arXiv:2111.07832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.814069Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:2ec87f88b27196e8b1798d970cf006f64f07b61e9843ba165cb3035525a3670c","observation_id":"3a2932da-f0a4-413f-a27c-6f50635ac041","resolution":{"observed_at":"2026-08-16T04:40:27.814069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:28.190654Z","title":"yes” as the answer and 120 questions have “no","venue":null,"work_id":"21c82853-550f-4fee-8f4c-eaa78d915323","year":2023},"citing_paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:27.818667Z"},"links":{"citing_paper":"/paper/2505.00788"},"observation_digest":"sha256:d3c7f5f8c753115f843d669b171d273ed040bc66f1bbee8b32264cfd1a7f4871","observation_id":"40f19090-a735-4d0d-a78f-2b57a9580da8","resolution":{"observed_at":"2026-08-16T04:40:28.195914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.00788","last_updated":"2025-06-10T17:54:02Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T04:21:51.921262Z","submitted_at":"2025-05-01T18:36:17Z","title":"SpatialLLM: A Compound 3D-Informed Design towards Spatially-Intelligent Large Multimodal Models"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 1 inbound Pith citation observation for arXiv:2505.00788."}