{"as_of":"2026-08-19T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3485a0d27beaa0558481a610ca5fd6798f3d4ba0744c4ecfc7fc9adfacc1490c","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:07:09.859176Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.17595/citation-record","integrity":"/paper/2508.17595/integrity","json":"/paper/2508.17595/citation-record.json","paper":"/paper/2508.17595"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.420010Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"74382dca-6f33-468a-b63d-081f6f8e5cde","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.724943Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:db043008ed0af09a674a4ee81c06b5c501d917287490c26d3d89424fa8014911","observation_id":"13a425ea-cabe-4d18-9c8f-d328ba2295ec","resolution":{"observed_at":"2026-08-15T17:07:10.425566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.401337Z","title":"Spatial- rgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"28f91625-bcca-4996-b5fd-dac8611138e7","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.730624Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:74fd8d08709c0605ba05a42f79ca5cb45275709afad84b027df163692b7be07d","observation_id":"a693fb44-c00b-4473-bdee-174a06ca1aae","resolution":{"observed_at":"2026-08-15T17:07:10.407806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-08-18T11:08:09.822131Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-15T17:07:09.736041Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understand- ing, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.736041Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:a0d89aa893f8a0a1143fde451645c295ad2cbf77f682232544f6ac3ca0972465","observation_id":"5f32692a-f101-4fee-a90b-a1b6bcbbc49b","resolution":{"observed_at":"2026-08-15T17:07:09.736041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.378936Z","title":"Fusemoe: Mixture-of-experts transformers for flexi- modal fusion","venue":null,"work_id":"9b37c029-9ad0-4857-8f9c-569c85726560","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.741439Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:be8246ba8500bb09d8161f15e659ece110d23c089f65fda91784d0e253166e7f","observation_id":"e0418e18-c407-440a-a0df-efafedc7d4d9","resolution":{"observed_at":"2026-08-15T17:07:10.387153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.356589Z","title":"Multiply: A multisensory object- centric embodied large language model in 3d world","venue":null,"work_id":"774494c9-52fb-48aa-8614-cdcd2fcf4e80","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.746747Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:b4b47361dbe3c5a732e6bff8d69844b1841dbb77c4c6a2e39019d991367958d1","observation_id":"53d91718-43ab-4106-908a-f24f64b5211e","resolution":{"observed_at":"2026-08-15T17:07:10.361885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.336334Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"e6c561d5-efe3-46dd-ac96-77a90abd6eed","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.751482Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:d746ea2f4e2dd623ddcda2798185026b57af90472e0b5f27cd37c59ff8d63423","observation_id":"ee59531c-505a-474a-9225-12b090e87e3a","resolution":{"observed_at":"2026-08-15T17:07:10.344898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.310257Z","title":"Jordan and Robert A","venue":null,"work_id":"a54de0b8-1fd0-4993-b977-ac8d07bfca26","year":1994},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.756907Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:cb12f2b5e47a0bd0ba8e2f96638c311b6e963987d69ec3ff4947ec9391cb1987","observation_id":"715c92b2-a6a4-4655-b77f-327de8a955cb","resolution":{"observed_at":"2026-08-15T17:07:10.316607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.282943Z","title":"Chang, and Manolis Savva","venue":null,"work_id":"0f71c941-de7d-4f9f-80f0-6f55deb3a614","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.761344Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:f5630d017d4874b2ae76b437602158da57984a6c2048f66ede20aafbe050546b","observation_id":"f6badd95-d893-4aad-8ea6-a1bd72969f74","resolution":{"observed_at":"2026-08-15T17:07:10.292549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.258126Z","title":"Sparse mixture- of-experts are domain generalizable learners, 2023","venue":null,"work_id":"3fe0f328-2620-4f90-abc6-402e646f4c54","year":2023},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.765896Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:6ec51e97633c924faf806d1df1ea146c9af797edfba3b332779522f26a6d1cf2","observation_id":"3f7d3547-81db-4fe4-a64f-e979f8ba1835","resolution":{"observed_at":"2026-08-15T17:07:10.264764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:09.770372Z","title":"Shapellm: Universal 3d object understanding for embodied interaction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.770372Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:f4c5dbd05cdb229d71eea30df2a7cbbc712d118e057e32130c08eda10a498830","observation_id":"2724bc3e-3750-4f21-b47d-0347ba17e308","resolution":{"observed_at":"2026-08-15T17:07:09.770372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.225131Z","title":"Gpt4point: A unified framework for point-language understanding and generation","venue":null,"work_id":"e820a101-eba7-4cab-b506-68e98f5fc921","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.775396Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:a666415a22513511a98cc2b58c3339398da8a873839540c65fcc787ae76abcbb","observation_id":"7f5e2d44-26b1-4470-9a43-05d4f8d085fd","resolution":{"observed_at":"2026-08-15T17:07:10.233071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.201048Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"4550bcef-6266-469a-8e95-d21b6b5367e5","year":2021},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.780162Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:246e00b6b89b4c54cbddfb8a1de81e229a42ef6d36561808d269645c2232fe05","observation_id":"24acd481-5d72-453e-a989-3d9fd703fdee","resolution":{"observed_at":"2026-08-15T17:07:10.208589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.182823Z","title":null,"venue":null,"work_id":"425cf230-ca9a-4eb3-a040-6e0458364446","year":2020},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.785362Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:b529f2c46dc452eeb61312bc717f316738891c3719de30b74545e99177c525bd","observation_id":"f73a2fa5-567a-4dbb-84db-052a23f17d30","resolution":{"observed_at":"2026-08-15T17:07:10.188461Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.156639Z","title":"Vi- sion transformers for dense prediction, 2021","venue":null,"work_id":"9a410a2a-1b47-4941-82c3-c232b51e0eb9","year":2021},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.790035Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:e2d5ed3b7a12ecf96356c317cfa6b6d1e45b28419fad414ca393c658613d118c","observation_id":"2a77a542-21cd-4354-bf39-0a6d2849be32","resolution":{"observed_at":"2026-08-15T17:07:10.166335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T17:07:09.794766Z","title":"Outra- geously large neural networks: The sparsely-gated mixture- of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.794766Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:1a714a26fd48aea09a95b3d610238085c6ea0bc8048bf91be5ba17baef6381f9","observation_id":"02d569d2-dbda-466e-864e-5818c7333c82","resolution":{"observed_at":"2026-08-15T17:07:09.794766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:09.799816Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.799816Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:68776a25e2a00b9b067a0cdaa9d2c07440d3e4d13c435c19d6561fe54982b4b6","observation_id":"d804690d-9b08-43e8-99c0-20ec5e3ee2ce","resolution":{"observed_at":"2026-08-15T17:07:09.799816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.128122Z","title":null,"venue":null,"work_id":"0dc36600-911f-43a9-b191-86cf3bd090c5","year":2025},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.804311Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:cbb8fc4c453601aeafac46a585324952d5e49109b0b198530a5a38ed3701feb4","observation_id":"0aab04aa-d72d-422f-80f7-dda01a989a25","resolution":{"observed_at":"2026-08-15T17:07:10.133677Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08769","last_updated":"2023-08-17T03:52:15Z","snapshot_observed_at":"2026-08-16T15:07:56.298993Z","submitted_at":"2023-08-17T03:52:15Z","title":"Chat-3D: Data-efficiently Tuning Large Language Model for Universal Dialogue of 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08769","snapshot_observed_at":"2026-08-15T17:07:09.809207Z","title":"Chat-3d: Data-efficiently tuning large language model for universal dialogue of 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.809207Z"},"links":{"cited_paper":"/paper/2308.08769","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:eef3a190dbc3cc0a8d081795f004cebed45a48ba9018b9287f40a08a8a915f99","observation_id":"940ea8e0-4bdd-49e8-bb14-0fdf162b5e12","resolution":{"observed_at":"2026-08-15T17:07:09.809207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:09.814047Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.814047Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:24807c95a7b250f07b6e4e9d0875defa1d9e493a1302105a69bc07dc177f6da3","observation_id":"fba8d501-18e3-406c-a043-f593a8fea8d3","resolution":{"observed_at":"2026-08-15T17:07:09.814047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:07:09.819128Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.819128Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:3629e93260f77b75e45431d073024de748ff8e6b8d2fe17c1632e07eab9e513d","observation_id":"9f8d59fc-f8fe-4668-88a2-f8836c1e8ae2","resolution":{"observed_at":"2026-08-15T17:07:09.819128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.090455Z","title":"RoboPoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":"2d21d8d0-51b7-460f-8463-41c5fce850f3","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.824467Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:0e580e6f8cc049e87ade15387c19a9c33fcfe0dbb6624a8f56fbac5e28745be4","observation_id":"0ef245bd-565d-493a-b113-6dc16de3fb31","resolution":{"observed_at":"2026-08-15T17:07:10.097315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.067965Z","title":"CounterCurate: Enhancing physical and semantic visio- linguistic compositional reasoning via counterfactual exam- ples","venue":null,"work_id":"96964d1d-07de-4942-9f4d-27b65c1bb68c","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.829131Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:0f0748def412c4e93e69698875dc61d5ca2009b471c73af2b52745694c500eac","observation_id":"e1ba79ab-a99f-439d-9ae7-090dc7b80a6d","resolution":{"observed_at":"2026-08-15T17:07:10.075430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:09.833896Z","title":"Pointclip: Point cloud understanding by clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.833896Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:f77eedfcd2a40e6f49337bfce49d6cf0b8788f9ebdded953716206765c652bb6","observation_id":"baff45ea-33b3-4324-850e-03b46679490e","resolution":{"observed_at":"2026-08-15T17:07:09.833896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.039173Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding","venue":null,"work_id":"ff453877-8fba-4326-b765-6f0aff1e54a0","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.838882Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:6061a49609cd45f3e9aeb450b6b05231764dcb49142c3a1b107a810bb852e6d1","observation_id":"3459d38e-c90d-4178-9ab2-1d9b097dae74","resolution":{"observed_at":"2026-08-15T17:07:10.044370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-16T14:53:22.965811Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-15T17:07:09.844137Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.844137Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:1aa899dec84753bd78715b17463ca352825e355c747b26fd69636370d7b62acf","observation_id":"67fc2bc3-27b0-4f3c-ab1f-274ad0d5b818","resolution":{"observed_at":"2026-08-15T17:07:09.844137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:10.020933Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"11d08197-b183-4b2a-8f43-d9d0f91a29cc","year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.849489Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:b2ca4de9dbe3fd74c825059ffd1cb69a3ebcba6157d4a81c894b9e2db5108eb7","observation_id":"5358cf3b-e0cd-4e85-a541-bad5a4f793e0","resolution":{"observed_at":"2026-08-15T17:07:10.027399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-15T17:07:09.854311Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.854311Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:d7ffcceac54c435ac9a53ef08d316439a473cba9a29a57068b429141f98273df","observation_id":"eb5a55ea-172b-4544-977b-fbe6895be27e","resolution":{"observed_at":"2026-08-15T17:07:09.854311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:07:09.996304Z","title":"Point- clip v2: Prompting clip and gpt for powerful 3d open-world learning","venue":null,"work_id":"4c770543-ca44-4718-8523-888fd9b92628","year":2023},"citing_paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:07:09.859176Z"},"links":{"citing_paper":"/paper/2508.17595"},"observation_digest":"sha256:5c1161d1f35f37e726d80ab5375135570a6d6f053da745f94c275d5e33c98bfa","observation_id":"c720176f-8496-45ca-b223-50f8b038d0ed","resolution":{"observed_at":"2026-08-15T17:07:10.006525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17595","last_updated":"2025-08-25T01:36:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T11:11:21.833666Z","submitted_at":"2025-08-25T01:36:22Z","title":"TinyGiantVLM: A Lightweight Vision-Language Architecture for Spatial Reasoning under Resource Constraints"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2508.17595."}