{"as_of":"2026-08-05T06:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ca876270aae0e14e2220046a4170e07bbb86f98092b128ef85611b91a568815c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:42:09.922300Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.09719/citation-record","integrity":"/paper/2605.09719/integrity","json":"/paper/2605.09719/citation-record.json","paper":"/paper/2605.09719"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T08:47:02.454321Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"336ecd50-6d81-4575-8053-d0a1850d9043","year":2021},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:477dde79e3171dccfdd163ed9988623ac9a4f00a408c94696bf29c84977e72fa","observation_id":"e92edeac-4e94-4f76-87c6-b4391a0fadbe","resolution":{"observed_at":"2026-05-12T22:01:53.549751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"f90c9906-892f-4b0b-81de-84d2b4832f16","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:b811b62274c5433692903bf4a4244f4fbb463d89e2d99d777e6ed7814bfa8833","observation_id":"ddb2c839-ccc8-48d3-a68d-d30bdf3bd1c2","resolution":{"observed_at":"2026-05-12T22:01:53.588332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superlora: Parameter-efficient unified adaptation for large vision models","venue":null,"work_id":"8ddc08e9-8d43-4807-b84a-e0739bf0d241","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:0b870265c52a0fd82ecb5b0483ffda8b7fe0a449ea9e5feb055d036f11f186b7","observation_id":"525f2561-b90f-43f9-97c3-16719d2ae51b","resolution":{"observed_at":"2026-05-12T22:01:53.625470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":"2409.18125","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-07-04T15:39:56.857028Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":"25557a62-345c-4dfe-a582-4ff77ad59e6a","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:cbdfd44e6d65f45c6c68bae14b126701d371247228382257892a5c5129c87d73","observation_id":"05ddfdf3-00fb-458a-aa00-d13e6dd877d0","resolution":{"observed_at":"2026-05-12T07:31:25.837388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":"b1f45731-f68e-4792-8282-f8b52958ff8c","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:b17d54c8998c0eb357ee3565e3639d5fe7fe82df7e7d1535322617bb0d47c8b0","observation_id":"5adcbd4b-9be4-4c71-b461-ad3354c9de6d","resolution":{"observed_at":"2026-05-12T22:01:53.563110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:fd4b1636dafb2f74eb28d6527a18b2632da4d600640837b30b69061aeb3aed52","observation_id":"5be164d3-752e-442c-96f6-7562dc3ef2d8","resolution":{"observed_at":"2026-05-12T07:31:25.817150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy and policy con- siderations for deep learning in nlp","venue":null,"work_id":"eb48d066-60cc-4662-9403-eba0d4dbe62d","year":2019},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:03b740efdf7c8243a0102da10dae1a402ae920d5ee02c1a9a6e28353dab5bdcc","observation_id":"03af8fc4-5078-4c72-9a37-4e7a4568dae6","resolution":{"observed_at":"2026-05-12T22:01:53.555522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mofa: A model simplification roadmap for image restoration on mobile devices","venue":null,"work_id":"4773594d-b8f2-4793-bdda-efcc0ed3aba5","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:6bb02c25b032d0106811454ba1cfd3edbbfc58b59a83137767e416e80628e1af","observation_id":"a0717ceb-85e3-4d71-b6f8-a4c976ba5f8b","resolution":{"observed_at":"2026-05-12T22:01:53.599268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning efficient vision transformers via fine-grained manifold distil- lation","venue":null,"work_id":"b58e65ca-b742-4d7a-b096-759a0a37a816","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:a0ed8ab5c9553ed9177f934b990bc4d71f73e8640214f70225146ee988d2d61f","observation_id":"b70e9e08-eb19-47bb-9a73-cce51385b84a","resolution":{"observed_at":"2026-05-12T22:01:53.579260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":"74881045-3b7f-470f-a60b-bcb9c55d5b1f","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:e6b63327dcb2571b2a5c651b4a8f2eb0740fd886e8f944d6071d6438687f860f","observation_id":"867bcbf9-6916-4fd2-aa8f-67e6d9da22f3","resolution":{"observed_at":"2026-05-12T22:01:53.569673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02108","last_updated":"2024-02-10T11:02:38Z","snapshot_observed_at":"2026-07-06T14:48:22.287400Z","submitted_at":"2023-02-04T06:30:57Z","title":"Knowledge Distillation in Vision Transformers: A Critical Review","version":2},"cited_work":{"arxiv_id":"2302.02108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2302.02108","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge distillation in vision transformers: A critical review","venue":null,"work_id":"42354deb-c133-4a9a-8e0b-be892afc6429","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2302.02108","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:c356456d003f2b1ebc1d20f94ea33ee98b1cb6b032c01f4fd7dea2fd1f5b8b1d","observation_id":"662e8702-89fd-43c8-b470-af7fa7a165fa","resolution":{"observed_at":"2026-05-12T07:31:25.793868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:8e02001b5476ae381fa33494f65a8869f22dee6f8d47f701ec8b6a1b9a1352b7","observation_id":"0ea23fa1-5629-47a3-9ea8-95a88aaecce3","resolution":{"observed_at":"2026-05-12T07:31:25.782086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge distillation: A survey","venue":null,"work_id":"dc8d6b28-24f3-4092-ae73-0fc20525f316","year":2021},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:1b188319b607be7257f28cd953155a4b9294abae839922fcd1ce02b75ca9e32c","observation_id":"925184fb-6836-4ae4-8527-70562bd4d48b","resolution":{"observed_at":"2026-05-12T22:01:53.585185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"77eade19-2c5b-4a36-a863-0c758ed905b4","year":2025},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:d6640ff5fd50ab434a1578ec1176b247bc6d164d0d017e7fb47def0928ab910c","observation_id":"e25fc2f8-f1a3-4f17-9d91-5120e8c4284e","resolution":{"observed_at":"2026-05-12T22:01:53.559507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pf3det: A prompted foundation feature assisted visual lidar 3d detector","venue":null,"work_id":"ebb043f2-f8f4-4e1f-82e9-45ac704b9123","year":2025},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:6453fea6082802c3da33841a7cb75565c392877350dad5d13bfa163aadb57d6e","observation_id":"618d2b07-ca86-4709-ae9d-ece36449725b","resolution":{"observed_at":"2026-05-12T22:01:53.553031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"bfc73ba8-e84c-4e94-92aa-51b7d879ecb9","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:9b047d29b42c5e7ff276bd1614ab70dd37732c4ac40ab7b1a2827f6d4f623804","observation_id":"6a03fc50-7737-40db-89a7-ae434cdd3350","resolution":{"observed_at":"2026-05-12T22:01:53.591433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"696ae598-aaa3-4971-aa00-80c2efa8006c","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:36a001fca62c6a63aa31f8467442f1c43e090025d436ac20e17dbdd4e18e266d","observation_id":"20a36fce-7480-4358-a812-70cbe8a1c51c","resolution":{"observed_at":"2026-05-12T22:01:53.576326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa: Visual question answering","venue":null,"work_id":"be14dca2-9e8e-4519-a9d5-4d629e96d54f","year":2015},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:8d15aa765cabd0bc13680f9d8ec91f76abdb7525218c28a525b0bca80b21312a","observation_id":"91293638-1e97-4309-b372-4bcd8c441f33","resolution":{"observed_at":"2026-05-12T22:01:53.572751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"d0e10dbf-1c28-4aa9-8e37-b400237167aa","year":2019},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:cb858117c54f13d85ab8c8291fe4c301d235e6c7fecf3781766260f0350ea22e","observation_id":"edae610a-5608-49f8-b3ab-43fe9fb6b450","resolution":{"observed_at":"2026-05-12T22:01:53.608767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":"6dbe9216-cf84-4913-a8f0-34dfe7473de1","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:05542bad370aea85eb8acf9d541b13ea66a838b9fa3d0cc248497e19e28d5e63","observation_id":"a3bdaee0-b542-432f-995c-81c4087057a2","resolution":{"observed_at":"2026-05-12T22:01:53.582327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distilling vision-language models on millions of videos","venue":null,"work_id":"eb4dfd3c-e7e3-4cd6-a49d-df5764adb06e","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:ea2f37489f77aa3194664e0fc4776fe4238ab3eed4b4b731dadd213d015ba902","observation_id":"5ddb7169-7dcb-4369-a3f1-e10f6a854a03","resolution":{"observed_at":"2026-05-12T22:01:53.595574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"2881ecf8-307a-4c75-a657-65d2aba95a90","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:ee4dc36f075959960b021eb386d20a9d16a8fc257ddf4b99f9fc1f09c2660149","observation_id":"f48b52ab-4f4b-4fb0-a155-076208245d16","resolution":{"observed_at":"2026-05-12T22:01:53.631866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large lan- guage models are zero-shot reasoners","venue":null,"work_id":"452bc081-b54a-4174-848e-e3c74522429e","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:66d41c8c6ae92195c8af5cf5f0e719de12d3e93fddf2355a708193490bf37349","observation_id":"040dcedb-fba4-47a6-bdfd-92ea217dbded","resolution":{"observed_at":"2026-05-12T22:01:53.629063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"b1c335ef-5755-44f6-8cab-77ea857921de","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:0a843e59c567be0282b2bccc3020b3355b8e7b63d947fbaeb9f7a3950b7bf633","observation_id":"bd00bbb6-2003-42be-9397-05e27e3274be","resolution":{"observed_at":"2026-05-12T22:01:53.612338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d-sps: Single-stage 3d visual grounding via referred point progressive selection","venue":null,"work_id":"6310f100-c2c4-4418-bcfe-e82a98d2e7aa","year":2022},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:31bd8a33b2a6cb68551651da5434b652ff23d7ecb0a60571b73ea25ed34d9c3b","observation_id":"7826bfbb-6c62-4c52-a68a-ac00e0869521","resolution":{"observed_at":"2026-05-12T22:01:53.605490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Embodiedscan: A holistic multi-modal 3d perception suite towards embodied ai","venue":null,"work_id":"95b8533f-cdb3-410f-94b7-4e16bb296e86","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:3516e033f5cfd0cfa175dc5e948d2f326a81c057e7b346829afee245c267af0c","observation_id":"48d7229e-af7a-4dea-adcc-ac08d9138960","resolution":{"observed_at":"2026-05-12T22:01:53.618681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:b6b03c4e2a84c892522bd2557eb1cecf620ded076925da3be601190a7fbb7a2f","observation_id":"0978cd05-e33f-4d50-a9ac-d118983477c2","resolution":{"observed_at":"2026-05-12T07:31:25.786761Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-07-31T09:25:34.205362Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":"2403.09629","doi":"10.48550/arxiv.2403.09629","metadata_source":"pith","pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","venue":"cs.CL","work_id":"cd82874a-9e9d-46cb-9716-a06d454a9c7e","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:8f1b1539c644490910a8b8e132980a9e6f8c2c15c2c61b92da17f00d39174a6a","observation_id":"c31dc4fd-7d8e-495e-8093-c25fb4d29b3f","resolution":{"observed_at":"2026-05-16T05:45:05.263509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-task learning using uncer- tainty to weigh losses for scene geometry and semantics","venue":null,"work_id":"fc1ea9c6-2608-4f67-91e2-04254d737138","year":2018},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:cac526c04906199d8e500753291e07ba0b8f527541815da07e0e200ba2be76ae","observation_id":"7e9b0384-ddb9-42dc-a6f0-6f7487a71550","resolution":{"observed_at":"2026-05-12T22:01:53.615682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"98ae7ae1-7a6f-447e-b150-75ace3f9c605","year":2017},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:ffd8571d60c66a70f14dfd71f82ac1b3ac88081720ac95df99ac0b72cfab1ba7","observation_id":"305e958b-9484-47a3-9910-51df8bdcba37","resolution":{"observed_at":"2026-05-12T22:01:53.566862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Midi: Multi-instance diffusion for single image to 3d scene generation","venue":null,"work_id":"9e663b03-dcac-4a4e-82ba-fb1d60b2ecc2","year":2025},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:4635066a7d81e84980516b1696bdb1e74dce6e33020b2b3b82ceeb84fab123df","observation_id":"ba99407b-ae00-4aae-b5f8-0f22e57927a7","resolution":{"observed_at":"2026-05-12T22:01:53.622240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"cited_work":{"arxiv_id":"2511.21471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.21471","snapshot_observed_at":"2026-07-04T08:59:43.334805Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","venue":"cs.AI","work_id":"81942f57-c90d-41fc-9036-779f35d52bed","year":2025},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2511.21471","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:c310c4450d425b97155bd8d60518446ac0eaa7f629c7d6c7cea85f4874c86c4f","observation_id":"25791731-a687-4d60-9f62-bb59acbb3940","resolution":{"observed_at":"2026-05-12T07:31:25.822356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3dsrbench: A comprehensive 3d spatial reasoning bench- mark","venue":null,"work_id":"de106643-fc64-44a2-891e-2241da1ae885","year":2025},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:e23b98a281714051ccd9bb295c457e333b043ed9ffba58243cc3c995dd45baf2","observation_id":"0bc4c46f-7df8-4b1d-a268-eed16a45a5f9","resolution":{"observed_at":"2026-05-12T22:01:53.602712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":"2312.16886","doi":"10.48550/arxiv.2312.16886","metadata_source":"pith","pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","venue":"cs.CV","work_id":"ef2b3279-e78f-44b7-abab-ed7d011dc1cf","year":2023},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:34618fd19334f98cd6c4f8c4cf901405db0b24b6406a65c4e0a1d7c322ba07b3","observation_id":"649bd923-e9ca-44a5-82c5-65922f10d106","resolution":{"observed_at":"2026-05-16T16:35:38.347525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-04T10:58:38.750074Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T02:42:09.922300Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2605.09719"},"observation_digest":"sha256:305fd5c5960354defa7f9c6a4487cefeb7b7af0efe58d631eccd434207b60f69","observation_id":"8df35154-8f87-4997-9cb5-5fc8610a04a6","resolution":{"observed_at":"2026-05-12T07:31:25.802386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.09719","last_updated":"2026-05-10T19:38:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T06:20:11.964388Z","submitted_at":"2026-05-10T19:38:29Z","title":"Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":26},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2605.09719."}