{"as_of":"2026-08-08T04:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c5f65cd82b298dab024558f71440a8734b8a3468ef0c33456671628ece886de","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:49:59.483783Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14228/citation-record","integrity":"/paper/2607.14228/integrity","json":"/paper/2607.14228/citation-record.json","paper":"/paper/2607.14228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:52.981552Z","title":"Cognitive maps in rats and men.Psychological review, 55(4):189, 1948","venue":null,"work_id":null,"year":1948},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:52.981552Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:0e18c15c9ffe60587eabba26e83c9a7aa1b67639290e8f28aaad3eca278ea014","observation_id":"abc15ddd-c321-47e8-a778-8c6473bffc0e","resolution":{"observed_at":"2026-08-02T02:49:52.981552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.049361Z","title":"Psychology press, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.049361Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:26055c9cdb25cb15bdcc1ac08fa4e0dd3fc89185a731307ac05b511b954b28c7","observation_id":"4d34e24c-9b29-48a1-87bb-6ff6ca5504cb","resolution":{"observed_at":"2026-08-02T02:49:53.049361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.124576Z","title":"Mental rotation of three-dimensional objects.Science, 171(3972):701–703, 1971","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.124576Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:6ce3fccccef49594fbddc225e8af04b1d1511ceb752255a1cada61790709729b","observation_id":"c50de181-4e2f-4eda-babe-0fa32b484600","resolution":{"observed_at":"2026-08-02T02:49:53.124576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.215235Z","title":"Routledge, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.215235Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a00a416137299bdc061ec828e4afd44bf2506641d4486e290dec9c5b56305663","observation_id":"5cf72d12-03ea-45f0-a3a9-3c12cc85a67c","resolution":{"observed_at":"2026-08-02T02:49:53.215235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.305240Z","title":"Allocentric and egocentric spatial representations: Definitions, distinctions, and interconnections","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.305240Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ccbea6ac19f9bea93d438f3dcba3ff2fbd9227652b2bd6b525291369d897f278","observation_id":"4a2946a3-ddf0-4e1f-b706-039ad811336c","resolution":{"observed_at":"2026-08-02T02:49:53.305240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.392665Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.392665Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:8036f0acb80f8b8d1f8c82120f57694f32d8caac39f6ee3912fa85d131b90de6","observation_id":"aebe0e12-5b96-4c55-a0c7-8b732084eae4","resolution":{"observed_at":"2026-08-02T02:49:53.392665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.515355Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.515355Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b7a71ab4e9db01288b4565a4f36b23f39fa1f08bd3d30ddcb36b3145ca364c71","observation_id":"6f1f561b-de63-4b9e-8af4-cd2ed30d1c09","resolution":{"observed_at":"2026-08-02T02:49:53.515355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.604225Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.604225Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:6ea1acfed083618df5da371695153b3c77d8349c4a3f482c4250f5e43f732f84","observation_id":"c089dfc0-b922-47c0-88c4-1ae40947a7c7","resolution":{"observed_at":"2026-08-02T02:49:53.604225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.689989Z","title":"Efficiently reconstructing dynamic scenes one d4rt at a time.arXiv preprint arXiv:2512.08924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.689989Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b543dad92d7d2c6d6f5bd0ef31f8ee35e85fc41debe2e50746b045c56145399b","observation_id":"9801fa88-3373-4ad5-aa04-b99a89395f2e","resolution":{"observed_at":"2026-08-02T02:49:53.689989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.781220Z","title":"IndyPublish.com, 1709","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.781220Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:9aebaea0f0e6e6c68fd1c735b395fd59a37a73a9d0a1cd439f4dd2a2d848b03b","observation_id":"bff512d8-de4d-4ac6-bc4f-3a0c5a79ef2d","resolution":{"observed_at":"2026-08-02T02:49:53.781220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.866266Z","title":"Movement-produced stimulation in the development of visually guided behavior.Journal of comparative and physiological psychology, 56(5):872, 1963","venue":null,"work_id":null,"year":1963},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.866266Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:408b40671d9f895f1b1485279fda39258f8ff6131a3746704c8a4f430ec87070","observation_id":"69632af4-7365-4b31-903d-d0608a64732f","resolution":{"observed_at":"2026-08-02T02:49:53.866266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:53.952244Z","title":"Dover Publications, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:53.952244Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:369a1402e562142193dfd09ba19b9682a2d55c9577d3f578247cf77bcadb4838","observation_id":"56980e35-3452-4591-ae6d-19b8515908e2","resolution":{"observed_at":"2026-08-02T02:49:53.952244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.011355Z","title":"Probing the 3D awareness of visual foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.011355Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d5163c1e55f32a30397d6ac7d9fea437a3b8d6f4cb67a607a1edd30b1db4ed55","observation_id":"0ee60687-7eb5-44e5-87fd-57dcd074851b","resolution":{"observed_at":"2026-08-02T02:49:54.011355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.099584Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.099584Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5713a3e956abc458a4641319c05e5f5bb525e4e2bc880b9fc289a0c45ca27adf","observation_id":"716dd49a-403e-4f69-a629-b9404d70075f","resolution":{"observed_at":"2026-08-02T02:49:54.099584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.216540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.216540Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f5b47c364acf975cc5c9a709633f442d3e9b90beb242f007e5831aa969f0b172","observation_id":"c110b14d-c84c-4992-b867-e25a2f25dec0","resolution":{"observed_at":"2026-08-02T02:49:54.216540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.318110Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.318110Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:45501471e502dd3532faef1e68e533b29b984a131c4e722a141ebaa11dae820f","observation_id":"c46e67e7-d231-4ecd-a6c4-6edd5d5e9b3d","resolution":{"observed_at":"2026-08-02T02:49:54.318110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.384049Z","title":"Nomad: Goal masked diffusion policies for navigation and exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.384049Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:7393d64dcd45946bc74d5605cf1e38cc4d2ec282d41e768682024e23bff5b594","observation_id":"06e67f82-a6df-43cb-90d6-f000dd7f573f","resolution":{"observed_at":"2026-08-02T02:49:54.384049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11812","last_updated":"2024-08-21T17:57:51Z","snapshot_observed_at":"2026-08-03T05:45:43.939088Z","submitted_at":"2024-08-21T17:57:51Z","title":"Scaling Cross-Embodied Learning: One Policy for Manipulation, Navigation, Locomotion and Aviation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11812","snapshot_observed_at":"2026-08-02T02:49:54.476331Z","title":"Scaling cross- embodied learning: One policy for manipulation, navigation, locomotion and aviation.arXiv preprint arXiv:2408.11812, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.476331Z"},"links":{"cited_paper":"/paper/2408.11812","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b839495848974e674af45afd0c034f6547527d232861832c104cb81f7127a360","observation_id":"9adbfae2-0075-4fa5-9f5f-951ba7a449a8","resolution":{"observed_at":"2026-08-02T02:49:54.476331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25937","last_updated":"2026-06-15T19:34:05Z","snapshot_observed_at":"2026-07-13T17:55:05.093630Z","submitted_at":"2026-03-26T22:04:49Z","title":"Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25937","snapshot_observed_at":"2026-08-02T02:49:54.572749Z","title":"Can vision founda- tion models navigate? zero-shot real-world evaluation and lessons learned.arXiv preprint arXiv:2603.25937, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.572749Z"},"links":{"cited_paper":"/paper/2603.25937","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:0a146e86396b67b3cdc7360eaefe0aebeae8642e138c876234f124457fb89139","observation_id":"cf8919a2-38cd-4aeb-93ff-c49775824eab","resolution":{"observed_at":"2026-08-02T02:49:54.572749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:54.686992Z","title":"Navigation world models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.686992Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f286b5a68b6c8dc388dbd5c0fa35312efa8b1397d45aff2e5b73211173e834c6","observation_id":"0bb7320a-0447-44c3-8fb7-4adbbf2b4f92","resolution":{"observed_at":"2026-08-02T02:49:54.686992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-02T02:49:54.804262Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning.arXiv preprint arXiv:2603.14482, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.804262Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b40a026f011fe36ed986953d5bf7805988120c06c3c5b5dc3e16e5e127189f8c","observation_id":"905e69c5-6daf-496b-97a4-eaab25bba187","resolution":{"observed_at":"2026-08-02T02:49:54.804262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19458","last_updated":"2025-02-19T05:16:27Z","snapshot_observed_at":"2026-08-04T07:54:56.431304Z","submitted_at":"2024-11-29T04:02:11Z","title":"Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature Finetuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19458","snapshot_observed_at":"2026-08-02T02:49:54.935447Z","title":"Multiview equivariance improves 3D correspondence understanding with minimal feature finetuning.arXiv preprint arXiv:2411.19458, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:54.935447Z"},"links":{"cited_paper":"/paper/2411.19458","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b3e7b843dded37d54a184229701a1a7e2cac7efdd238fbd82c27b332bec1e02a","observation_id":"527f767b-c365-4942-8bdf-2c944d854ef2","resolution":{"observed_at":"2026-08-02T02:49:54.935447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-07T13:01:28.667448Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-08-02T02:49:55.065331Z","title":"Deep ViT features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.065331Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f590f96734715ac7265751e872765ed32811da1f7c76b6b9df70503998bf9620","observation_id":"97913c0c-7a46-4454-8f37-adad8f4aa698","resolution":{"observed_at":"2026-08-02T02:49:55.065331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.160484Z","title":"How much 3d do video foundation models encode?arXiv preprint arXiv:2512.19949, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.160484Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:9c5ea13eb3b5ed6a85c4bde770ecdb73b86fea1367033502ce6d2149dcf0e4ce","observation_id":"436b372f-a22c-47b2-8ac7-242871704021","resolution":{"observed_at":"2026-08-02T02:49:55.160484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.258462Z","title":"Lexicon3D: Probing visual foundation models for complex 3D scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.258462Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:e6c638a7cd57b94bc4ef7ef16495ccda5049cbfda7e961b1943befdcc6584936","observation_id":"c33fe453-0ab4-418d-a067-95dc4e4309e2","resolution":{"observed_at":"2026-08-02T02:49:55.258462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00987","last_updated":"2023-06-01T17:59:57Z","snapshot_observed_at":"2026-07-06T15:36:45.014921Z","submitted_at":"2023-06-01T17:59:57Z","title":"StyleGAN knows Normal, Depth, Albedo, and More","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00987","snapshot_observed_at":"2026-08-02T02:49:55.355388Z","title":"Bhattad, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.355388Z"},"links":{"cited_paper":"/paper/2306.00987","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:29569ae24f870672f072a6a50897ea363fb350555de8125defbe49b5ced44285","observation_id":"eeaf119c-bcfc-420a-a1ed-f43da3a5c3db","resolution":{"observed_at":"2026-08-02T02:49:55.355388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05720","last_updated":"2023-11-04T19:22:35Z","snapshot_observed_at":"2026-08-02T13:34:52.246639Z","submitted_at":"2023-06-09T07:34:34Z","title":"Beyond Surface Statistics: Scene Representations in a Latent Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05720","snapshot_observed_at":"2026-08-02T02:49:55.448225Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.448225Z"},"links":{"cited_paper":"/paper/2306.05720","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5f1968b91be34267b1afade0f3db5c9520df7de2ec102112dc35f3d6bed0aa27","observation_id":"f8cb63e4-e76e-4f21-8b0e-6d6f1beb3a89","resolution":{"observed_at":"2026-08-02T02:49:55.448225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.570997Z","title":"Campos, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.570997Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:507a209bbb7dbf2f5c3cbc0e2cefed9033ac93e56f5d35bd38448d220da8a308","observation_id":"bacba978-6287-46ce-86d4-d7e488b9d4a7","resolution":{"observed_at":"2026-08-02T02:49:55.570997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.638240Z","title":"Rust: Latent neural scene representations from unposed imagery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.638240Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b49de7b760f676519339314ec9b71085e819c04f29e8da3175f0504737083759","observation_id":"029de8cc-ef3c-47f1-974f-94a46e1acf5c","resolution":{"observed_at":"2026-08-02T02:49:55.638240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.716510Z","title":"True self-supervised novel view synthesis is transferable.arXiv preprint arXiv:2510.13063, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.716510Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d0ee321336a6163477218dad46b43a57081e703c6c0d853727f099fd8dae7b10","observation_id":"72687d56-268b-4d3a-a8d1-f9c3a9b3078c","resolution":{"observed_at":"2026-08-02T02:49:55.716510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.806542Z","title":"Primary visual cortex straightens natural video trajectories.Nature communications, 12(1):5982, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.806542Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f886c5082fcf2b6ca434949b9f3293186b08dd875b8aa800a25fb1d748260441","observation_id":"6a7f768b-2608-4e6b-9d5c-c1fb394f5c19","resolution":{"observed_at":"2026-08-02T02:49:55.806542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.19312","last_updated":"2026-06-03T18:50:40Z","snapshot_observed_at":"2026-08-06T05:42:53.129146Z","submitted_at":"2026-03-13T19:48:14Z","title":"LeWorldModel: Stable End-to-End Joint-Embedding Predictive Architecture from Pixels","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.19312","snapshot_observed_at":"2026-08-02T02:49:55.870956Z","title":"LeWorld- Model: Stable end-to-end joint-embedding predictive architecture from pixels.arXiv preprint arXiv:2603.19312, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.870956Z"},"links":{"cited_paper":"/paper/2603.19312","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ac19526a278a6667d7b55badeead7acf199d625b954603d8348c510d170f3088","observation_id":"517bff1d-2a43-439b-abc4-02ebf34b8d08","resolution":{"observed_at":"2026-08-02T02:49:55.870956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.933754Z","title":"Sorscher, G","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.933754Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:116a5b2f2c8ae44fa3fc6f4bb12b248e5cd89a62007091e22fe38619480ea7c9","observation_id":"4e26114e-7e7e-4114-8726-a6e1c60672a7","resolution":{"observed_at":"2026-08-02T02:49:55.933754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:55.984214Z","title":"Dorrell and J","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:55.984214Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:191fac193594cb1ce8daa8d358fc7ea401960e6ac5971e22fdc305b98c213d10","observation_id":"38c0bcb6-da57-4c76-b9b3-3eca2023ff80","resolution":{"observed_at":"2026-08-02T02:49:55.984214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.037020Z","title":"Gnm: A general navigation model to drive any robot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.037020Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:44c117a3848c2be1372d017dcf68c411e66bf363e468e16798340429268a35be","observation_id":"7a7ac742-71a8-4e4c-946b-d4649f289da3","resolution":{"observed_at":"2026-08-02T02:49:56.037020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14846","last_updated":"2023-10-24T06:16:43Z","snapshot_observed_at":"2026-08-07T21:06:01.525655Z","submitted_at":"2023-06-26T16:57:03Z","title":"ViNT: A Foundation Model for Visual Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14846","snapshot_observed_at":"2026-08-02T02:49:56.083126Z","title":"Vint: A foundation model for visual navigation.arXiv preprint arXiv:2306.14846, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.083126Z"},"links":{"cited_paper":"/paper/2306.14846","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:3f49e19682934135c29970788a042ff7d23a2a934831e735594c1ae835eb5d25","observation_id":"5a79a019-96fe-4527-a696-b9995511514e","resolution":{"observed_at":"2026-08-02T02:49:56.083126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.155175Z","title":"Prior does matter: Visual navigation via denoising diffusion bridge models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.155175Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:63ff3ae255199d7dcd99aa94066316c8af03a5863e2a92287088da0c8d126d04","observation_id":"1f6c77c8-b31c-47a2-9d6a-09bd4647a054","resolution":{"observed_at":"2026-08-02T02:49:56.155175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.241144Z","title":"Navmorph: A self-evolving world model for vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.241144Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:69da513b7c2ce23166de578727eaf684dd73d354a0edc4b12a0bbb1c5a4ea9fa","observation_id":"4d0196cc-37aa-42f9-9fc4-6bc9337c24f6","resolution":{"observed_at":"2026-08-02T02:49:56.241144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.341371Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.341371Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5c9f796a2f90bd7b799b8cde68445a9936744eb02bb86edf7b0c35bc74e14ad5","observation_id":"3fcb7345-4b99-498f-88a3-085a995326c3","resolution":{"observed_at":"2026-08-02T02:49:56.341371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.454674Z","title":"On the continuity of rotation representations in neural networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.454674Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5d9928d775da23f98a916e1aba57ad028b4e413c9f8260b50b90f8ce984a2208","observation_id":"aa71d981-1bf6-49ea-8a24-9e1c027e651e","resolution":{"observed_at":"2026-08-02T02:49:56.454674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.516350Z","title":"Self-supervised video pretraining yields robust and more human-aligned visual representations.Advances in Neural Information Processing Systems, 36:65743–65765, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.516350Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:cbc01dd0b2c9187b2e52ba6bee01d5e6e8a309dae91a674151eeb90767b64764","observation_id":"e42c3677-62e8-4b9a-bef8-8b4e16305ec9","resolution":{"observed_at":"2026-08-02T02:49:56.516350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.564938Z","title":"Learning predictable and robust neural representations by straightening image sequences.Advances in Neural Information Processing Systems, 37:40316–40335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.564938Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a00f88c57040d38bd9ff80ee77ec330b05480ad34675322b4d4ed77e1934223c","observation_id":"d27bbe7e-07ed-422a-a21d-09d129d744e5","resolution":{"observed_at":"2026-08-02T02:49:56.564938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.636786Z","title":"Chirality in action: Time-aware video represen- tation learning by latent straightening.Advances in Neural Information Processing Systems, 38:92695–92726, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.636786Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:1fb657f2ca7bfc9b58c85cf61dfca448af2666d6b7999da4945597806969489f","observation_id":"23f875ec-66c3-4b6a-81c2-efd334e60abd","resolution":{"observed_at":"2026-08-02T02:49:56.636786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.744669Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.744669Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:7846fe143307d6efaa357c056a4e9039f4e1fd15951f58f35e7755e9a89f4a6a","observation_id":"e99781bd-c9e8-455b-9f1e-2a18051fe855","resolution":{"observed_at":"2026-08-02T02:49:56.744669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-02T02:49:56.808587Z","title":"ARKitScenes: A diverse real- world dataset for 3D indoor scene understanding using mobile RGB-D data.arXiv preprint arXiv:2111.08897, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.808587Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:3ad19a223dc5b5c7580ba22d39cb3ad34c280e7664d86675fb44c79d17394f5a","observation_id":"0b459d38-1fcd-4282-8e8b-bfb8eee4339c","resolution":{"observed_at":"2026-08-02T02:49:56.808587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.893180Z","title":"A benchmark for the evaluation of rgb-d slam systems","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.893180Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:10f1ef0899c0f8246f49e398843df4e6fce71c25b30425e97d1d3ea482731b7d","observation_id":"2668e327-5819-453e-9656-8e7e1cc4ab4b","resolution":{"observed_at":"2026-08-02T02:49:56.893180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:56.973347Z","title":"Learning to navigate the energy landscape","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:56.973347Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b5df16267c6b2f61a0ba033ae0acb3b68d6c095b6dbc0a9059fa0e9c893e252e","observation_id":"a1201391-512e-476f-a256-5a017b6a88f4","resolution":{"observed_at":"2026-08-02T02:49:56.973347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.050629Z","title":"Scene coordinate regression forests for camera relocalization in rgb-d images","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.050629Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:81d3517e656a4fc676e07bc15867c57fba7c8e670cca832cdd2ef5c209a9b1a9","observation_id":"fb4af697-c1a8-44bf-98c7-2fce3ff0f392","resolution":{"observed_at":"2026-08-02T02:49:57.050629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-02T02:49:57.142226Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.142226Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:d239c1105d5595f731083441a6038d855b47e43f4d6321425e4cc4c682201610","observation_id":"4e102c2d-4df4-4b50-af62-06b01aa7f961","resolution":{"observed_at":"2026-08-02T02:49:57.142226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.215197Z","title":"Dynamic reflections: Probing video representations with text alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.215197Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5fbbe30c164c4ea54b1e15c30cd5fce9d08dca2b1ebe0a054947db359f52ac38","observation_id":"d697c8ec-8b33-4776-8cb1-3892afa8949a","resolution":{"observed_at":"2026-08-02T02:49:57.215197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.292862Z","title":"Levina and P","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.292862Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ef3fbab66dfad0a7ca767966f61e535ff8f0a260ed3a99f7edb98a8217087af8","observation_id":"be26553a-3552-4c36-8aeb-f0c2812f48e5","resolution":{"observed_at":"2026-08-02T02:49:57.292862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.346388Z","title":"Facco, M","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.346388Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ce32914b18df7541bf5339103d0f930f49121b6d13f772ef8ef1a5268e4b07c6","observation_id":"61f6e82c-d9c1-4c4a-86e9-fea2f4c3fc39","resolution":{"observed_at":"2026-08-02T02:49:57.346388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.421861Z","title":"Large vision models can solve mental rotation problems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.421861Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a684b655324e189e3711e4258125e71cdb3e816257eef9654a91fb6805497a55","observation_id":"93c315d6-3ab2-457a-9df9-94a83504b5e2","resolution":{"observed_at":"2026-08-02T02:49:57.421861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.485784Z","title":"Metzer, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.485784Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:373350e16cd33dc16e5aeba784b63ea642ec7d3e0cc12ab0591f5461c2ee0e23","observation_id":"e042461d-e095-4ea4-a994-ae21a15e5b57","resolution":{"observed_at":"2026-08-02T02:49:57.485784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.576148Z","title":"Weinzaepfel, V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.576148Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b32a66c293693917e3307d9953d24ed5b745fc5986d7404acbe7d6bd63be582f","observation_id":"7927f8b3-1617-4758-aaac-7abd1360f4e7","resolution":{"observed_at":"2026-08-02T02:49:57.576148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T02:49:57.638611Z","title":"Oquab, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.638611Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:fe57ad0766e70dda422e6a9960bf24cf489812f6340a59e15d413214bb98ea7e","observation_id":"a8b9e026-77dd-4961-a767-d591b1edd188","resolution":{"observed_at":"2026-08-02T02:49:57.638611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T02:49:57.712413Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.712413Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:e94e167b8049ec5c41a1efdf79a163e305bd0258ba4d55a83a0ff1ecc789466c","observation_id":"0221beee-885b-43b2-8e17-3d49a8747b36","resolution":{"observed_at":"2026-08-02T02:49:57.712413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.797739Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.797739Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:22c6395a34e57aaee33e516a609e674bdb0b9a7d606e68ea359e868526974bfc","observation_id":"3b7e7e94-0001-4384-9083-90f7c5e08a68","resolution":{"observed_at":"2026-08-02T02:49:57.797739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:57.896652Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.896652Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:e5a53c816cdabc784ff82d254041bac48bfe1dc67771bf1f50e60a5348f41802","observation_id":"1185ec8e-b3fa-4b5b-bfae-7e3ab7b21e97","resolution":{"observed_at":"2026-08-02T02:49:57.896652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-02T02:49:57.960918Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:57.960918Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:267157083b20626c077207d439f71e95bb8bbd6310920ab9d76d28677d7b33e1","observation_id":"97935cd4-b992-4791-9cd5-9d226813e03d","resolution":{"observed_at":"2026-08-02T02:49:57.960918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13181","snapshot_observed_at":"2026-08-02T02:49:58.043393Z","title":"Bolya, P.-Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.043393Z"},"links":{"cited_paper":"/paper/2504.13181","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:016ae050134bc9d96713a726894f4139ef6d6a1e16d6cffb1a423368cbc98bfc","observation_id":"1c3ef910-2001-4736-9665-b815e1e8014c","resolution":{"observed_at":"2026-08-02T02:49:58.043393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15506","last_updated":"2025-01-03T15:39:16Z","snapshot_observed_at":"2026-07-06T18:04:42.102581Z","submitted_at":"2024-03-22T02:30:46Z","title":"Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15506","snapshot_observed_at":"2026-08-02T02:49:58.124847Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.124847Z"},"links":{"cited_paper":"/paper/2404.15506","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:05b2759d7145009349cc700f2324d7d70fdc16552c46988712fd756b21748a7d","observation_id":"fe9dc8d4-72ad-4aa5-bf33-44a4ff474d77","resolution":{"observed_at":"2026-08-02T02:49:58.124847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.202050Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.202050Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:50322e4c3a81443f066c89fa9a18a80d6472dcbbbcbb2acad9ef945ac9adebe1","observation_id":"4683a1c2-baf3-4d2c-85d3-e502e54c0ed0","resolution":{"observed_at":"2026-08-02T02:49:58.202050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-02T02:49:58.302430Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.302430Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:38b9b69d234d2884b76ac86685cfe99776c3a7b303950eb923c1057bbce00901","observation_id":"91c88214-b949-40b7-bccd-d265512f1b95","resolution":{"observed_at":"2026-08-02T02:49:58.302430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-02T02:49:58.367929Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference.arXiv preprint arXiv:2310.04378,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.367929Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a3e1c588d58e51aab543d861b2fff56252a600601d86e943eebbc1fec585ba9e","observation_id":"ba0b34cf-bdfd-467f-8851-0cdfeb4a6764","resolution":{"observed_at":"2026-08-02T02:49:58.367929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.430922Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence.Advances in Neural Information Processing Systems, 36:45533–45547, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.430922Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:f0c3928a0f580d70263d4005a9aa755258926141e2fa02fa5bdd9107652b7625","observation_id":"08e16a4a-2c95-4db6-aaa3-14fd56b6c285","resolution":{"observed_at":"2026-08-02T02:49:58.430922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-02T02:49:58.501052Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.501052Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:5e40a2b8e945093ba6accd3a79a5546078b6e974f8063a3b881e09fe36978116","observation_id":"2b3f3b6a-c014-4870-8016-c62f21f9272d","resolution":{"observed_at":"2026-08-02T02:49:58.501052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.578183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.578183Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:e75a0c66b925f7fd3eceebc8f845dece49e7c9be1e528615abcde6773551679d","observation_id":"d4ed38c1-cc13-4ce3-ae93-cac2fb767ecf","resolution":{"observed_at":"2026-08-02T02:49:58.578183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13684","last_updated":"2026-04-21T13:13:49Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T18:59:48Z","title":"Recurrent Video Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13684","snapshot_observed_at":"2026-08-02T02:49:58.651651Z","title":"Zoran, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.651651Z"},"links":{"cited_paper":"/paper/2512.13684","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:44fa4229573aa1cc2743e9acd22d9cea635e5ad11e3c3c828a7c9b7db2c7bf87","observation_id":"51feaf88-b823-4728-85a6-4e7dd96ffd06","resolution":{"observed_at":"2026-08-02T02:49:58.651651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-08-02T02:49:58.712379Z","title":"Carreira, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.712379Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:1adb9856851b3b01612132b06a48f061b4661f766b80c7d238c995fa1f6f65e0","observation_id":"50b5a864-d3ae-4dc9-a564-937d49a0c200","resolution":{"observed_at":"2026-08-02T02:49:58.712379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04085","last_updated":"2026-05-26T17:38:05Z","snapshot_observed_at":"2026-08-07T12:33:34.943380Z","submitted_at":"2025-12-03T18:59:57Z","title":"Unique Lives, Shared World: Learning from Single-Life Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04085","snapshot_observed_at":"2026-08-02T02:49:58.824241Z","title":"Unique lives, shared world: Learning from single-life videos.arXiv preprint arXiv:2512.04085, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.824241Z"},"links":{"cited_paper":"/paper/2512.04085","citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:b5b6596c313777736058f12e2406106af1f6ebca272a8b33281b120547c4b18b","observation_id":"78791446-e291-4a38-bbda-d49a52715330","resolution":{"observed_at":"2026-08-02T02:49:58.824241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.840176Z","title":"Federer.Geometric Measure Theory","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.840176Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:eae6a95f8da2f9a39650ecc7b825bf630a2796a3bde853db9c866d9bad7f7890","observation_id":"db5def9b-f9f3-4d5d-ace9-e3671e274b2c","resolution":{"observed_at":"2026-08-02T02:49:58.840176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:58.905734Z","title":"Poincaré adapter","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:58.905734Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:ea6a03e930c75b6f3ed924fab19f74e08976658d6713ce7541a0fe0c0d6e11af","observation_id":"dbf5769f-0494-422a-91d5-2c34e6466393","resolution":{"observed_at":"2026-08-02T02:49:58.905734Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.072704Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.072704Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:c9b9542c851de2d1c8927882095da09ad7c09999c37b79d8133b745aef1ca045","observation_id":"5aa69a4f-d736-426a-a0b2-af120773764d","resolution":{"observed_at":"2026-08-02T02:49:59.072704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.198448Z","title":"Proof.We address each claim sequentially:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.198448Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:a45967a3725cbc856453842d004db4bba61069c411ee1b4853a814f46c7ffd57","observation_id":"5eabfbd2-12cf-4033-9970-10decafa53de","resolution":{"observed_at":"2026-08-02T02:49:59.198448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.295400Z","title":"Thus, time t influences the visual observation solely through the trajectory C(t), making P:U → Ia well-defined mapping that assigns a unique, repeatable image to any specific pose","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.295400Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:21b74df1982c8c5884a5a5fda7d5f014a62c9777387354a6f8553910d8bdeb4e","observation_id":"c480148f-0e6e-4e91-bd26-a3700c3edb69","resolution":{"observed_at":"2026-08-02T02:49:59.295400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.387324Z","title":"The domain of valid poses U is an open subset of the Lie group SE(3), which is a smooth manifold of dimension 6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.387324Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:deae0162bbf7d221cada786d30453ae12f30960500bb5c78bbc25f965cf7a8bd","observation_id":"3490b16b-cb2e-48c3-8438-390f1ff3f40c","resolution":{"observed_at":"2026-08-02T02:49:59.387324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:49:59.483783Z","title":"move forward 1 meter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T02:49:59.483783Z"},"links":{"citing_paper":"/paper/2607.14228"},"observation_digest":"sha256:18cf5f361ca0840b06c2f595593cde56b876db58646891ef5e4adb184f1ee6b9","observation_id":"7e6c24f8-5f94-411a-9715-e7f5b9ec8b7c","resolution":{"observed_at":"2026-08-02T02:49:59.483783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14228","last_updated":"2026-07-15T18:00:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T19:15:40.699682Z","submitted_at":"2026-07-15T18:00:31Z","title":"SeeSE3: Emergence of 3D Space in Vision Features"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.14228."}