{"as_of":"2026-08-09T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb8fdcd97cf4bf336b4b337d61fb02cc3a6c8dd287f6e5f9653bfe43488c4042","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:06:09.998507Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T13:45:53.346402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T08:46:26.794017Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2603.16461","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.16461","snapshot_observed_at":"2026-07-21T02:21:33.200827Z","title":null,"venue":null,"work_id":"542a436b-ef11-42ec-9a93-1ef717a34763","year":2026},"citing_paper":{"arxiv_id":"2604.26341","last_updated":"2026-04-29T06:46:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T06:46:59Z","title":"SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T13:45:53.346402Z"},"links":{"cited_paper":"/paper/2603.16461","citing_paper":"/paper/2604.26341"},"observation_digest":"sha256:0cadc80135009550e1609f347ec2cba268f83e33af3ff825da547812a77e55f5","observation_id":"d237b7b1-64a0-4574-a2ca-0b54252f643b","resolution":{"observed_at":"2026-07-21T02:21:33.200827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.16461/citation-record","integrity":"/paper/2603.16461/integrity","json":"/paper/2603.16461/citation-record.json","paper":"/paper/2603.16461"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.807506Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.807506Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:8e365f9dbf84a3a0c9b9f549944f4112efdf9d6bfd3c1f73314736ecfe7ece9a","observation_id":"1fcca2d3-6baa-47b7-8752-d99503cc7058","resolution":{"observed_at":"2026-08-02T18:06:09.807506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:06:09.811884Z","title":"arXiv preprint arXiv:2511.21631 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.811884Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:27b7472ab575fe1f28c6aa08f7ad48d8b95ca6b534bdde588d15547847df4112","observation_id":"588d605b-4154-431c-985a-d2060adfd6fe","resolution":{"observed_at":"2026-08-02T18:06:09.811884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T18:06:09.815651Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.815651Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:8a0603509894d17d8bcaebdb5285fbbd4c8cd7c6748f073c8aea80178e6de9ad","observation_id":"f15bb0ec-165c-4d4c-a020-de0815af47f5","resolution":{"observed_at":"2026-08-02T18:06:09.815651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.819064Z","title":"arXiv preprint arXiv:2509.25413 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.819064Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:d6d58c70196efdce1b08ca53fbf292eeda0f3ede701466b3bc63a20eaa75f936","observation_id":"25a8376b-b6bb-462f-8fe2-911d0a8d9ffd","resolution":{"observed_at":"2026-08-02T18:06:09.819064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.822371Z","title":"arXiv preprint arXiv:2410.01647 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.822371Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:d1d3a85047932ba5e4d3c586df787ab6859d5b34d002b332b50095856532acac","observation_id":"47a236d9-50b0-4486-9aa9-2dd88e24b991","resolution":{"observed_at":"2026-08-02T18:06:09.822371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.825904Z","title":"arXiv preprint arXiv:2603.00912 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.825904Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:4190433c2ca09841a368f4b90ee45a1558df3060c02464610dd272d56b74c308","observation_id":"d91e9bb2-c90b-47e9-995b-1e675a7f17e5","resolution":{"observed_at":"2026-08-02T18:06:09.825904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.829387Z","title":"Advances in Neu- ral Information Processing Systems36, 71862–71873 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.829387Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:da9117a899f9f156917c12a30ef3772b1285e8beebcf98504603d589ca9b5bc9","observation_id":"c9d2f36b-d8fd-44fa-af04-709617b99728","resolution":{"observed_at":"2026-08-02T18:06:09.829387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.832361Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2025) 16 J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.832361Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:8d7988a51afc67e8c0c8d13b6f3196c685bd846ebbb6b39222b48b5bc600ea4d","observation_id":"e1e9b0cd-778b-47c5-bfb4-bb6f69abcef3","resolution":{"observed_at":"2026-08-02T18:06:09.832361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.835431Z","title":"In: ECCV (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.835431Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:f19ae2aaa7becfab948f8263bd93143eea8deaf45c93f3ce786e7cf6394b858a","observation_id":"54160019-3dae-432b-aaec-93892e3d85f5","resolution":{"observed_at":"2026-08-02T18:06:09.835431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.838718Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.838718Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:a7f9a880c129b63747c441b82703728d831cf706aa424225a8d8f6a564dd73e8","observation_id":"f8eb9a3c-6c97-408b-94bb-96d489c796a1","resolution":{"observed_at":"2026-08-02T18:06:09.838718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.841836Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.841836Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5905e9e4b1b4135f4359aa94c3287f959c88c4714829a027c3f44a07a5fb618b","observation_id":"865af6f7-82c8-426b-b558-9455f2c59ac4","resolution":{"observed_at":"2026-08-02T18:06:09.841836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10370","last_updated":"2024-11-18T08:29:08Z","snapshot_observed_at":"2026-08-05T04:37:45.202508Z","submitted_at":"2024-05-16T18:03:41Z","title":"Grounded 3D-LLM with Referent Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10370","snapshot_observed_at":"2026-08-02T18:06:09.844829Z","title":"arXiv preprint arXiv:2405.10370 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.844829Z"},"links":{"cited_paper":"/paper/2405.10370","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:57c5359d7a82160cb729b75e971094f555e2452bce3c5444407c4ffa34f7e698","observation_id":"bed21cab-d60b-4396-8cd9-23f130b683c3","resolution":{"observed_at":"2026-08-02T18:06:09.844829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.848516Z","title":"arXiv preprint arXiv:2510.13800 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.848516Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:0a8c156a93d66c0ecc38bc1b03520591c488fd14256fcfba681d953d614bc4db","observation_id":"1f64a274-e475-47fe-b58a-bd512e9662a3","resolution":{"observed_at":"2026-08-02T18:06:09.848516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.851409Z","title":"In: Proceedings of the IEEE/CVF conference on com- puter vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.851409Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:909ffca6ebe8b599680a0af85bc703ee95a6a8529cb3476d66696fca8a061a48","observation_id":"65e5a41c-1917-4984-9027-4369647c380a","resolution":{"observed_at":"2026-08-02T18:06:09.851409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.854350Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.854350Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:f160094de83c37c1fdc65fb68d60170ab1fe30ad41024f64d3c7a36fa1767fe3","observation_id":"1652069e-2d10-4ccb-b348-c4396a15c58b","resolution":{"observed_at":"2026-08-02T18:06:09.854350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.857411Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.857411Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:1b9fe6794da42edbd6f7ec6dcbc94a5a6ff8d39d8e5c55776b655a4432b33baa","observation_id":"e6760b3f-42a1-4d6a-b51e-d5f753e5cbc7","resolution":{"observed_at":"2026-08-02T18:06:09.857411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19516","last_updated":"2023-10-30T13:18:31Z","snapshot_observed_at":"2026-07-06T16:40:28.142296Z","submitted_at":"2023-10-30T13:18:31Z","title":"Generating Context-Aware Natural Answers for Questions in 3D Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19516","snapshot_observed_at":"2026-08-02T18:06:09.860375Z","title":"arXiv preprint arXiv:2310.19516 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.860375Z"},"links":{"cited_paper":"/paper/2310.19516","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:bea6af6acfa817af8e27d23a6643b8ad75a17cc1394e0c8a0babfedf811514a3","observation_id":"3dc177dd-407d-4269-87e4-f8868b2ef40c","resolution":{"observed_at":"2026-08-02T18:06:09.860375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-02T18:06:09.863681Z","title":"arXiv preprint arXiv:2505.20279 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.863681Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:c9db7e48c3b32e811c6f2726f5a25a4a848f752e84510be1624c172ed348de45","observation_id":"2ecc57ab-2221-4b00-8e81-684fbf08f0ed","resolution":{"observed_at":"2026-08-02T18:06:09.863681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-02T18:06:09.866812Z","title":"arXiv preprint arXiv:2503.21776 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.866812Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:4bc4e514de840a886a0069419c6bd75512a67bf62dfef493772ad6a01a88b471","observation_id":"3bde5895-7a6b-4d60-ab7c-f20a72793119","resolution":{"observed_at":"2026-08-02T18:06:09.866812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.870167Z","title":"arXiv preprint arXiv:2601.11442 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.870167Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:d09c4345c8bacd420b9abd3dfe435779eb8bfb9fb3cb8aa5cc1ca8cd4ff68780","observation_id":"2a134d4a-f2a0-4caa-bd2a-39920d8eadf3","resolution":{"observed_at":"2026-08-02T18:06:09.870167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.872927Z","title":"Cambridge university press (2003)","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.872927Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:1681d817f698f7ac9f932b9faf1aee65afb2cbcf4757328c89e4b83bfb1609e8","observation_id":"3efb21c4-a27f-4919-9719-3a056ab52254","resolution":{"observed_at":"2026-08-02T18:06:09.872927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.875787Z","title":"Advances in Neural Information Processing Systems36, 20482–20494 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.875787Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:6a499e4cdf2a88f94ed634bbf2fcf969d72c29dfec64b0f64d7f6abcbc72fc9c","observation_id":"198bf949-7719-4d36-8145-8662a659a0c8","resolution":{"observed_at":"2026-08-02T18:06:09.875787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.878556Z","title":"Advances in Neural Information Processing Systems 37, 113991–114017 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.878556Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:ef123613b46c3a2bcf49ba8addad6de4a239c9f7b4b9a72835d49013d21ce67a","observation_id":"d4faea79-27b4-400f-8d07-ef075bd40540","resolution":{"observed_at":"2026-08-02T18:06:09.878556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-02T18:06:09.881685Z","title":"arXiv preprint arXiv:2311.12871 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.881685Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:660870c770a2915642bc3a83be24acf21ef11ed168f6456fd5a0697c086739ae","observation_id":"98843dd9-ff48-49ea-855b-63b32843dc1f","resolution":{"observed_at":"2026-08-02T18:06:09.881685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T18:06:09.884802Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.884802Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:4c1c57d9b8d83925a5f5bc83fb6025c9b9a7545eae4bd078040dc522d964f6a1","observation_id":"900369b8-9543-4269-95d4-364584a09cd7","resolution":{"observed_at":"2026-08-02T18:06:09.884802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-07-06T22:30:07.020487Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-08-02T18:06:09.887988Z","title":"arXiv preprint arXiv:2509.13414 (2025) GAP-MLLM 17","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.887988Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:12dbc1629c927dbb8e7154704815099998971f229e2bdfb4bb1c0fb7c553f1e8","observation_id":"23ae736e-4d64-4c03-82b2-9b1a1fc80846","resolution":{"observed_at":"2026-08-02T18:06:09.887988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-02T18:06:09.891673Z","title":"arXiv preprint arXiv:2406.09246 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.891673Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:7eea260f68ee300be40b38823fa5b280ace2b5a96b33e6d74a785f286770a4dd","observation_id":"66d9e8f8-8ab9-47af-bb2e-9b7deed37f30","resolution":{"observed_at":"2026-08-02T18:06:09.891673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.14364","last_updated":"2026-06-01T12:40:47Z","snapshot_observed_at":"2026-08-08T11:23:54.955713Z","submitted_at":"2025-12-16T12:49:35Z","title":"Unified Semantic Transformer for 3D Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.14364","snapshot_observed_at":"2026-08-02T18:06:09.895072Z","title":"arXiv preprint arXiv:2512.14364 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.895072Z"},"links":{"cited_paper":"/paper/2512.14364","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:a559915f6c5deecb41a4d9abcc34636afb0cf7d9ab5d9ada65688dd3aabd32bd","observation_id":"7c711c68-0cd5-4ef3-98d1-cbe8c254770f","resolution":{"observed_at":"2026-08-02T18:06:09.895072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-02T18:06:09.898270Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.898270Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:e02fc88dcf8b4136810b303cf9d261b3fe115b180374130950fb78bc2c8b7e4e","observation_id":"6b970326-5b68-49a3-9c94-3448979b1a73","resolution":{"observed_at":"2026-08-02T18:06:09.898270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.901428Z","title":"arXiv preprint arXiv:2510.22706 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.901428Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:bac65cb417d25d8c1bdf3691fb40e5d0125fb5d23c0c58b7ee1b2ac69696e4fe","observation_id":"57d1d639-d6e9-4f89-9fd7-6ca76690e7d7","resolution":{"observed_at":"2026-08-02T18:06:09.901428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.904718Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.904718Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:c7085069a47b61e48fd6f550723842aafcf12d1acdd9cd557c802c68d6e22544","observation_id":"5ddf83bc-5c11-4ff4-8d26-92fcb9e5b908","resolution":{"observed_at":"2026-08-02T18:06:09.904718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-02T18:06:09.907725Z","title":"arXiv preprint arXiv:2511.10647 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.907725Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:859ab66a2c2c8066059184ddda54c9df611bc957dafccd7b383cc82e03a63596","observation_id":"1c2048f2-77fc-4502-be11-51f8fd6b0096","resolution":{"observed_at":"2026-08-02T18:06:09.907725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.910861Z","title":"arXiv preprint arXiv:2405.10255 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.910861Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:a1150665feea1a10220b045d498eec63feef33773aaa455445436e9d1c9611a8","observation_id":"d1939b48-2b0a-46e4-ab41-826f6277cc82","resolution":{"observed_at":"2026-08-02T18:06:09.910861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.914100Z","title":"In: Ad- vances in Neural Information Processing Systems (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.914100Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:70ce5ae84ac80a43f73d6b3280ae78a64db3ec19d99746d2c432dc68e75af393","observation_id":"0db83715-bbc9-488e-a1a5-06f8bbdab8dc","resolution":{"observed_at":"2026-08-02T18:06:09.914100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.917331Z","title":"Ad- vances in Neural Information Processing Systems37, 23464–23487 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.917331Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5791b3a77e4730b12f2d8f33b481a39601cbfb5220278bba4111a3a3fbb34cb4","observation_id":"f23dd2db-0b40-466f-9558-fc66b03e51eb","resolution":{"observed_at":"2026-08-02T18:06:09.917331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.920391Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.920391Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:09b4365dc2a88b63f0b35e6fec0d21eac274046818620b0f45cfc16ff6fe6c8d","observation_id":"9b22861a-8f8a-46fd-b74a-89800da0ddc2","resolution":{"observed_at":"2026-08-02T18:06:09.920391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.923398Z","title":"In: proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.923398Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5f4ae060340f56395a012eb3baa76dcdc9a31698f2c63945cadd0f70ce84f7cf","observation_id":"db357836-d2ad-4316-87a1-1dac645ee97f","resolution":{"observed_at":"2026-08-02T18:06:09.923398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01428","last_updated":"2025-03-11T07:54:04Z","snapshot_observed_at":"2026-08-06T23:31:17.110793Z","submitted_at":"2025-01-02T18:59:59Z","title":"GPT4Scene: Understand 3D Scenes from Videos with Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01428","snapshot_observed_at":"2026-08-02T18:06:09.926358Z","title":"arXiv preprint arXiv:2501.01428 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.926358Z"},"links":{"cited_paper":"/paper/2501.01428","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:2bc22e5e1abdc70c66c250d27afe313fb5624330e2c466f5f741553e3024efd2","observation_id":"0ee15ea0-69cc-44c5-9b2c-8fcee3ae62f6","resolution":{"observed_at":"2026-08-02T18:06:09.926358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-02T18:06:09.930155Z","title":"arXiv preprint arXiv:2501.15830 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.930155Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:709aba00e2958bd9166db3eb01a552402dbd24457fb1ea0115320fac4d20cb1e","observation_id":"f15d34ea-ab75-40ff-903a-ad20c3dda213","resolution":{"observed_at":"2026-08-02T18:06:09.930155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.933431Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.933431Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5606b79c1c6cc2836b91793a1533087a0f053e0f7a1d6c51699d36c25c061911","observation_id":"eacb1e50-027d-460a-8a57-898cd3310017","resolution":{"observed_at":"2026-08-02T18:06:09.933431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.936478Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.936478Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:87c1c221414ff4c36d2c96d5c10e45ce866c6520a346daf06b7f8867cc7b8cf9","observation_id":"326b211d-d163-4176-b133-6e05c5826e14","resolution":{"observed_at":"2026-08-02T18:06:09.936478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02560","last_updated":"2025-11-09T15:12:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-02T17:54:21Z","title":"FastVGGT: Training-Free Acceleration of Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02560","snapshot_observed_at":"2026-08-02T18:06:09.939650Z","title":"arXiv preprint arXiv:2509.02560 (2025) 18 J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.939650Z"},"links":{"cited_paper":"/paper/2509.02560","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:afac023758ae2f472ae86b9a15ecf3db56a7c27170e1fce3339e9a94a56a9489","observation_id":"fd1a76a0-11b3-4788-8627-18c2e0d58dcd","resolution":{"observed_at":"2026-08-02T18:06:09.939650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.943321Z","title":"arXiv preprint arXiv:2505.23044 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.943321Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:0ebc57ffaa3ee4bc7b012bed6988552a2b27d3f3875bc098805cc1b7cbe6accc","observation_id":"9d43fbef-8407-46c1-a296-a98901fcaeef","resolution":{"observed_at":"2026-08-02T18:06:09.943321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-02T18:06:09.946206Z","title":"arXiv preprint arXiv:2403.05530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.946206Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:8855cef8ff5537259774e225fb479f6e18a1c634cfe608e1c99f33a6e358930e","observation_id":"2f6bd746-e000-4fc3-b695-c9b154cf2774","resolution":{"observed_at":"2026-08-02T18:06:09.946206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.949484Z","title":"arXiv preprint arXiv:2511.18416 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.949484Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:e9094c65a6d8e34e04216881866366bd8fb9d87d4f17f625855440e646015e03","observation_id":"e8811f6d-b96f-4be4-908d-793fcdd8b17a","resolution":{"observed_at":"2026-08-02T18:06:09.949484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.952498Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.952498Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:68deee4f628133d4a1b6512562d6f2c854b310686cc7511be67053c088ffea6e","observation_id":"0ad40dd2-a235-4352-8aa0-e4fa2126fb4d","resolution":{"observed_at":"2026-08-02T18:06:09.952498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.955607Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.955607Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:fecd2586957f63c4c3dae990669680f7e970ec0443f465840110bf83e7617bde","observation_id":"f2c85b51-1ce0-4a92-aff2-fab8181a1f78","resolution":{"observed_at":"2026-08-02T18:06:09.955607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.958696Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.958696Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5ff4fcd94f97d225be7d9502ee667406f870691c5fb3e5516a2169309bd40340","observation_id":"0833805c-8384-4d0d-8a36-13af845644f8","resolution":{"observed_at":"2026-08-02T18:06:09.958696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.961597Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.961597Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:50decc302b60cf35998f68551f5df6967d3b33557c693c47313faf60bf113237","observation_id":"0a629d8d-6cb2-4e7c-86c7-512679084b05","resolution":{"observed_at":"2026-08-02T18:06:09.961597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-02T12:12:15.465550Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-08-02T18:06:09.964640Z","title":"arXiv preprint arXiv:2507.13347 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.964640Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:318ddb03c128f0021fd52bd54a2cfc157622f072f31fa191e8f3b2324ac76d07","observation_id":"51656720-c56f-4e2d-9d4c-ac62b7aa7b21","resolution":{"observed_at":"2026-08-02T18:06:09.964640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-02T18:06:09.967760Z","title":"arXiv preprint arXiv:2505.23747 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.967760Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:df01d57cfb1db1b7038a2a36ff8f487d75eb33046059417c6ee3fc49a4a07808","observation_id":"68d5ae86-8032-4c38-8bb0-745e36e66c59","resolution":{"observed_at":"2026-08-02T18:06:09.967760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.970802Z","title":"arXiv preprint arXiv:2508.11952 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.970802Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:dfd4e76f81722fca3f6cf12649f4ef5726d4e93085940bb29b7b13c70665ff6b","observation_id":"0a8323a6-c07f-4d7a-b729-77691eb92f5a","resolution":{"observed_at":"2026-08-02T18:06:09.970802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.973850Z","title":"In: Pro- ceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.973850Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:70d921196da5187dda755c7d80e3917a19bd32e0120b6bf354e280d912eac5e8","observation_id":"d383857f-9b51-417f-b0ad-bd974ab490f3","resolution":{"observed_at":"2026-08-02T18:06:09.973850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.976837Z","title":"arXiv preprint arXiv:2511.05491 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.976837Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:5926946b3bda73f60a9547ea5eef1298ac5cfe2fbc72b0849502b3e53ac73a00","observation_id":"79cf545c-addb-4ace-9c0f-ae7939298575","resolution":{"observed_at":"2026-08-02T18:06:09.976837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.979716Z","title":"arXiv preprint arXiv:2601.02281 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.979716Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:7e993b74bb9fabd089ad6860440055806d520c6bbadd7eda054994aa824a27a1","observation_id":"54d77854-2572-4d74-804c-64e05ccdb025","resolution":{"observed_at":"2026-08-02T18:06:09.979716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.982621Z","title":"arXiv preprint arXiv:2503.22976 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.982621Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:9a4f2ba7b399d229fe46f31547c6994dc9d05d592ca33f8439117b96a6285143","observation_id":"154fce46-323e-4dc9-9ba1-038e1a5b9367","resolution":{"observed_at":"2026-08-02T18:06:09.982621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.985621Z","title":"arXiv preprint arXiv:2505.24625 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.985621Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:a5b56c6b82b6dcdc8d0a66cad5387a167236e0c9b1399c2bb2a220c7c73c64a8","observation_id":"f0e2179d-74d7-4342-9ece-3a69ed43b3fd","resolution":{"observed_at":"2026-08-02T18:06:09.985621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.989175Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.989175Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:957f0093356219d7027067a307ca08003cead5207f7559f926dbb96330afb0e5","observation_id":"f6c37f8d-50d4-47e7-84f0-4a726b9ed11a","resolution":{"observed_at":"2026-08-02T18:06:09.989175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.992189Z","title":"arXiv preprint arXiv:2510.25760 (2025) GAP-MLLM 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.992189Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:218c22b19222efb99601fa4af855ee09585f2de7d99933a77e8ae08ee843504d","observation_id":"046d1603-6434-4f23-b3ef-35111921709d","resolution":{"observed_at":"2026-08-02T18:06:09.992189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-07T23:35:09.059226Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-02T18:06:09.995051Z","title":"arXiv preprint arXiv:2409.18125 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.995051Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:48bed314e6cf69574356e0045cc40fdf7dc8acd6dcc1ef2bc53afa37ef02c53b","observation_id":"78606104-cf6a-4120-8cd3-97f27074cf27","resolution":{"observed_at":"2026-08-02T18:06:09.995051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:06:09.998507Z","title":"label\"and the point’s 3D coordinate in","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T18:06:09.998507Z"},"links":{"citing_paper":"/paper/2603.16461"},"observation_digest":"sha256:9e65238f5a476cb93529e77eebb989a11dc058d39fb060bc06465cf13b917545","observation_id":"7e7adcd3-e2ef-4b33-af1b-ab9fc07ef5a2","resolution":{"observed_at":"2026-08-02T18:06:09.998507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.16461","last_updated":"2026-07-20T02:21:38Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T13:28:18.188071Z","submitted_at":"2026-03-17T12:43:48Z","title":"GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 1 inbound Pith citation observation for arXiv:2603.16461."}