{"as_of":"2026-08-14T23:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26816ea74fa1a4598f94c5bd9fc71add46f32282556a1c8926e80fd7a4ee9ecf","coverage":[{"denominator":139,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:50:25.905855Z","state":"measured"},{"denominator":104,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":104,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T06:16:26.106940Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:40.359072Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22054","snapshot_observed_at":"2026-07-15T14:17:52.635563Z","title":"arXiv preprint arXiv:2601.22054 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.05711","last_updated":"2026-07-10T12:42:45Z","snapshot_observed_at":"2026-08-06T07:06:04.217463Z","submitted_at":"2026-03-05T22:08:40Z","title":"Any to Full: Prompting Depth Anything for Depth Completion in One Stage","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-15T14:17:52.635563Z"},"links":{"cited_paper":"/paper/2601.22054","citing_paper":"/paper/2603.05711"},"observation_digest":"sha256:f4cef6a43bf984ba20eabd4f47a4aafca6675a935f0d531169be3e672cfcc56a","observation_id":"dcb29b9b-c0cf-48d4-9ad7-0d074bd110f0","resolution":{"observed_at":"2026-07-15T14:17:52.635563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"cited_work":{"arxiv_id":"2601.22054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.22054","snapshot_observed_at":"2026-07-07T02:16:03.006629Z","title":"Metri- cAnything: Scaling metric depth pretraining with noisy het- erogeneous sources.arXiv preprint arXiv:2601.22054, 2026","venue":null,"work_id":"62516245-786c-41b5-b6a2-8da41eaf0094","year":2026},"citing_paper":{"arxiv_id":"2606.31488","last_updated":"2026-06-30T11:07:23Z","snapshot_observed_at":"2026-08-07T17:54:39.501832Z","submitted_at":"2026-06-30T11:07:23Z","title":"DrivingDepth: Sparse-Prompted Pixel-wise Scale Correction for Driving Depth Estimation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:09.975710Z"},"links":{"cited_paper":"/paper/2601.22054","citing_paper":"/paper/2606.31488"},"observation_digest":"sha256:fe237ebf35e6ee39065209bdad866016464701faa08584695ce48df421983f63","observation_id":"d4112ea8-919d-44c3-a35a-f67c52b2653a","resolution":{"observed_at":"2026-07-07T02:16:03.006629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22054","snapshot_observed_at":"2026-08-02T06:16:26.106940Z","title":"MetricAnything: Scaling metric depth pretraining with noisy heterogeneous sources.arXiv preprint arXiv:2601.22054, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.12993","last_updated":"2026-07-15T17:13:15Z","snapshot_observed_at":"2026-08-14T09:30:33.312879Z","submitted_at":"2026-07-14T17:45:50Z","title":"X-Lens: Real-Time Metric Depth Estimation with Heterogeneous Cameras","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T06:16:26.106940Z"},"links":{"cited_paper":"/paper/2601.22054","citing_paper":"/paper/2607.12993"},"observation_digest":"sha256:e0a26f3279607aa3f19d6975b4ee9780eb352888e21516c4ce2d9cef0eb87926","observation_id":"9fc4ae17-572b-49ca-915d-1502717dbdc1","resolution":{"observed_at":"2026-08-02T06:16:26.106940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22054","snapshot_observed_at":"2026-08-02T00:20:07.908257Z","title":"Metricanything: Scaling metric depth pretraining with noisy heteroge- neous sources,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15058","last_updated":"2026-07-16T14:32:34Z","snapshot_observed_at":"2026-08-05T11:33:59.836192Z","submitted_at":"2026-07-16T14:32:34Z","title":"SUFLECA: Scaling Up Feature Learning for CAD-to-image Alignment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:20:07.908257Z"},"links":{"cited_paper":"/paper/2601.22054","citing_paper":"/paper/2607.15058"},"observation_digest":"sha256:28c8ff79d68cd819e7477836d4851e3c18e7be6b2ec0664173f4ba302855a579","observation_id":"411bc03b-dcee-4eff-a9ae-97328fe9bd38","resolution":{"observed_at":"2026-08-02T00:20:07.908257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22054/citation-record","integrity":"/paper/2601.22054/integrity","json":"/paper/2601.22054/citation-record.json","paper":"/paper/2601.22054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:15.409504Z","title":"Mapillary planet-scale depth dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.409504Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:a1ee1e67488ca6434c6e1cf7c6fece7b4d107b605efabeb34b5f20b8528e9628","observation_id":"0b9b87d9-24ce-42ab-b974-e0aabcab792d","resolution":{"observed_at":"2026-08-03T06:50:15.409504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:15.444939Z","title":"Apollo synthetic dataset, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.444939Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:56a5932a293d0a656b2214a747d6b83f4507c7d73f627f5c637bbdc27766495e","observation_id":"671b749a-601c-49b6-ad85-6ab6dfe466f6","resolution":{"observed_at":"2026-08-03T06:50:15.444939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T06:50:15.535843Z","title":"Qwen2.5-vl technical report.ArXiv, abs/2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.535843Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:2ace85caa24da8d112d4870b4659c401f50825adf0d6da59b26cb223c68f716a","observation_id":"169a0e5b-1db5-4abb-86c2-3ca6849c0ec8","resolution":{"observed_at":"2026-08-03T06:50:15.535843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-03T06:50:15.640786Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data.arXiv preprint arXiv:2111.08897, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.640786Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:faecaabbe6a617c5949366053a09726fee54b3c82e1853bfb25a9dcee47b7fe7","observation_id":"b69636d6-2c1a-414c-be7c-5fc5e2f5f704","resolution":{"observed_at":"2026-08-03T06:50:15.640786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:15.722833Z","title":"Uasol, a large-scale high-resolution outdoor stereo dataset.Scientific data, 6(1):162, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.722833Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:613855766a6dc6254b8cf28989f9d25b6ce07db9795529ce1bd49d9de514b636","observation_id":"eaf88ebd-8255-47f1-89a1-1f9402b7355c","resolution":{"observed_at":"2026-08-03T06:50:15.722833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:15.843694Z","title":"Adabins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.843694Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d7aeba2f99d11921323d83c1b9bb9f7a64f347a817d41972fce35ef3a4ca1524","observation_id":"a5ba6f2d-c9f5-414b-8272-658d25f1d616","resolution":{"observed_at":"2026-08-03T06:50:15.843694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:15.964752Z","title":"Localbins: Improving depth estimation by learning local distributions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:15.964752Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:323c4c68be3540a01d4f42fdc1a5c4a4d3ed2ee4993d797ad358a3c45f162c8b","observation_id":"b1cd4763-d37c-461b-90b6-95d40993f5aa","resolution":{"observed_at":"2026-08-03T06:50:15.964752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.176980Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.176980Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:61dc6a2bb2da4c03d15f9573695f3f690a2dde9093cc71c80099974cc69bf8db","observation_id":"bf9f7ddd-0339-412c-a391-4faea3fb8491","resolution":{"observed_at":"2026-08-03T06:50:16.176980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.373035Z","title":"3d cavla: Leveraging depth and 3d context to generalize vision language action models for unseen tasks.arXiv preprint arXiv:2505.05800, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.373035Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:0ff7b71d54530dad7646985a74b516be95b180ce3f6bf68dd21bd190b030a492","observation_id":"1eed6ea3-5efc-4ba7-a8a8-02cba7421a0b","resolution":{"observed_at":"2026-08-03T06:50:16.373035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.491662Z","title":"Richter, and Vladlen Koltun","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.491662Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:66df6e92ee1706fd99bd822e0b757b7d6223fee551ac3a5fe751a3d177d21beb","observation_id":"f99e1e48-da21-4ea3-b2c9-447de1cd504b","resolution":{"observed_at":"2026-08-03T06:50:16.491662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.660992Z","title":"A naturalistic open source movie for optical flow evaluation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.660992Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:0a6845970907c41369604fc2a65ad7aa8c6a9d163dc841ca23fc9d69357a900f","observation_id":"2b4fd006-f366-4867-9ff4-e2543f35af94","resolution":{"observed_at":"2026-08-03T06:50:16.660992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.741854Z","title":"nuscenes: A multimodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.741854Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:411b9aeed6dcdc2c4e1967603da7464d0e03d8f79071365541d7a5f70986623a","observation_id":"89c1e0ad-4419-4324-b778-bf182ca22058","resolution":{"observed_at":"2026-08-03T06:50:16.741854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-03T06:50:16.813009Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.813009Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:660eab4f7950c84ddd24c59d62b3b00be0b5c63f7ff25450090cdd7839aa6874","observation_id":"5658bcff-3a6d-4ea5-993e-f50050af4386","resolution":{"observed_at":"2026-08-03T06:50:16.813009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.899414Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.899414Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6ba0d05f677253689a841f1a0d9900ea8bcfeebfb7aec29de16e21f1dc5ef052","observation_id":"7b0b49c5-6f02-470e-94a7-d244d5ac99d4","resolution":{"observed_at":"2026-08-03T06:50:16.899414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:16.983852Z","title":"Single-image depth perception in the wild.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:16.983852Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:42b4c75c1dfb06b7358d88432d9ee358dd40f4628f3ebb88bd74c1cda7c66d2f","observation_id":"68edc4b0-bd62-4e48-815a-1a24dcc27500","resolution":{"observed_at":"2026-08-03T06:50:16.983852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.040717Z","title":"Oasis: A large- scale dataset for single image 3d in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.040717Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:055a913c7ac6013aba6375bcd1dece90f5cb0c74ad1210c5dd62396fe565b1a1","observation_id":"5233b173-7f51-4dcd-a4a1-aebe2fbd61c9","resolution":{"observed_at":"2026-08-03T06:50:17.040717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.156826Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual- linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.156826Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:7508eb7aa6427a4cb48faf721b8a9256d67abe4d0a9e0a15dacf28b2a4b08539","observation_id":"602b04a3-f2a2-4d00-95f8-1667aa9395d5","resolution":{"observed_at":"2026-08-03T06:50:17.156826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.316977Z","title":"Cspn++: Learning context and resource aware convolutional spatial propagation networks for depth completion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.316977Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:99f2681fd412f5b32d61683c2f844d29fc0dd17c701c542d355ada7cd9cae8c0","observation_id":"0c465bd8-f1d1-43a7-8e5b-29ddf5833b8a","resolution":{"observed_at":"2026-08-03T06:50:17.316977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.426107Z","title":"Learning depth with convolutional spatial propagation network.TPAMI, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.426107Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6abe15682007d0f436ff67c83947b002691337bc8892a62ec4548f11a7f8773a","observation_id":"e40f5a6f-e565-4cf6-bf14-6d08aef4f74c","resolution":{"observed_at":"2026-08-03T06:50:17.426107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.471294Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.471294Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:9f155a3c4bd4a4c4397397989833db041500611d0fa5cfeafb825a69ea8b03bc","observation_id":"b285be4a-2d20-47d0-a35c-81da53b87c0d","resolution":{"observed_at":"2026-08-03T06:50:17.471294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.604744Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.604744Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:b4811406f6b706c30bee19145d3b712945f8f46c666dffa068bf6e09a31ab6d6","observation_id":"33e936d5-f433-433f-a955-6110e1098352","resolution":{"observed_at":"2026-08-03T06:50:17.604744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.703430Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.703430Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6de6de6c7aa6cd050f03d5108359b460ac5b2d9603adb91e6035f21de2bb2312","observation_id":"e105298c-93e0-4d97-893d-5aa5fc8c8f00","resolution":{"observed_at":"2026-08-03T06:50:17.703430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.777262Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.ICLR, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.777262Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:40f995015710c13bee4e41d364b6c55f958157ca211be8fe2fedf8d365334ed7","observation_id":"8caf3cd9-d25f-4386-8a66-90d3a9b2d72d","resolution":{"observed_at":"2026-08-03T06:50:17.777262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.867311Z","title":"Predicting depth, surface normals and semantic labels with a common multi- scale convolutional architecture","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.867311Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6bcae0f0ec4341aa77a54130b6ac9ffb93ba6e5cfc494a1cf514266695d9a211","observation_id":"83382cde-fe08-4f52-9e79-42655cd0be00","resolution":{"observed_at":"2026-08-03T06:50:17.867311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:17.967602Z","title":"Depth map prediction from a single image using a multi- scale deep network.Advances in neural information processing systems, 27, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:17.967602Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:5b0a7ac0499a20b489d026ffe72c4323f9cf131d506cdfa71a74b60c25c8cd19","observation_id":"992f3d03-bad0-4714-9c40-ac0aef6a5133","resolution":{"observed_at":"2026-08-03T06:50:17.967602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.081203Z","title":"Mid-air: A multi-modal dataset for extremely low altitude drone flights","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.081203Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:398125fd93c1e4624c14dabdd72d96363dac8c24d4ccdacd5d173ca92b97c31e","observation_id":"82148395-ffb5-4145-83e9-270d9c80c1fc","resolution":{"observed_at":"2026-08-03T06:50:18.081203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.169044Z","title":"Deep ordinal regres- sion network for monocular depth estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.169044Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:f075c7a734b38a8ecf87eccd7a02047209c81bfca66069c673d38140aa95c4c9","observation_id":"6cff9005-9c53-4b15-963e-9590a5643ef8","resolution":{"observed_at":"2026-08-03T06:50:18.169044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.342488Z","title":"Virtual worlds as proxy for multi-object tracking analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.342488Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:014b4af08a9a40e1c9ce9606225e8dbed65abc34f22a41831593a72c726c6ef5","observation_id":"ac30d20f-ca73-4df8-a293-613df0a337ae","resolution":{"observed_at":"2026-08-03T06:50:18.342488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.390705Z","title":"R4dyn: Exploring radar for self-supervised monocular depth estimation of dynamic scenes","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.390705Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e1d7d248a6f9af51a4d270fd3b1bc1442fb84f60c47b652ab309e4af0e4b959e","observation_id":"1f829107-7c24-4a5e-b03c-6c3b73270b23","resolution":{"observed_at":"2026-08-03T06:50:18.390705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.487589Z","title":"Dsec: A stereo event camera dataset for driving scenarios.IEEE Robotics and Automation Letters, 6(3):4947–4954, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.487589Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:294ca22f6d325e0283c954acd7b93d367d2c25e198dcbaeccf66991486e25fb6","observation_id":"4996d46c-4247-4b74-8dbf-c66a8a54abd5","resolution":{"observed_at":"2026-08-03T06:50:18.487589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.576276Z","title":"Are we ready for autonomous driving.The KITTI vision benchmark suite","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.576276Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:610f4e50593a18deeed02d8f40131b6c2170d24a409acd6644b49705a21d3d54","observation_id":"2f247cbf-8d83-4d14-92ac-5094b93ad3a3","resolution":{"observed_at":"2026-08-03T06:50:18.576276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.732340Z","title":"Digging into self-supervised monocular depth estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.732340Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d133999f6192951b98c0fe88915b14a23d5ed266e5f995da7ebadc90f308b309","observation_id":"803ac0dc-f13d-4bf6-b034-f07135bc3d79","resolution":{"observed_at":"2026-08-03T06:50:18.732340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.888403Z","title":"All for one, and one for all: Urbansyn dataset, the third musketeer of synthetic driving scenes.Neurocomputing, 637:130038, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.888403Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:306693fc2805f42e59c1c7ad53aa23500ef9d25bdde6976169991b23b6ed430d","observation_id":"1fd4e4af-cdbc-454a-adc2-fac2b333ceec","resolution":{"observed_at":"2026-08-03T06:50:18.888403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:18.991321Z","title":"3d packing for self- supervised monocular depth estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:18.991321Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:9dd3666f96be4faf4b49d0056921baf5a8af391e1bbbedff7f6121cc20a0a0cc","observation_id":"3ce68659-f048-4f12-a9ef-842115a951a2","resolution":{"observed_at":"2026-08-03T06:50:18.991321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:19.275100Z","title":"Towards zero-shot scale- aware monocular depth estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.275100Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:3e5a07ffa5aa6704a608757135a3b84b2a39f07400ffe044c6bbadd3ca9c42a9","observation_id":"4d763bcd-7604-4290-85e8-edfc9995381e","resolution":{"observed_at":"2026-08-03T06:50:19.275100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.14480","last_updated":"2020-11-16T21:16:49Z","snapshot_observed_at":"2026-08-12T07:43:26.279914Z","submitted_at":"2020-06-25T15:23:41Z","title":"One Thousand and One Hours: Self-driving Motion Prediction Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.14480","snapshot_observed_at":"2026-08-03T06:50:19.379655Z","title":"One thousand and one hours: Self-driving motion prediction dataset.arXiv preprint arXiv:2006.14480, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.379655Z"},"links":{"cited_paper":"/paper/2006.14480","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:51591f475748f10abbb24de49e4d3b8eba03593896f20a2585829e3b7f85c330","observation_id":"33f9032f-4305-4a8c-991e-093475876969","resolution":{"observed_at":"2026-08-03T06:50:19.379655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:19.534895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.534895Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:8bd2d7f3d6dfcc921aec2c21d5c2ef48a1b42fa858e4c69db23327dd3ab342e9","observation_id":"c3df8fbd-dc06-42a7-ad98-afcad0ab1e19","resolution":{"observed_at":"2026-08-03T06:50:19.534895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-08-03T06:50:19.646504Z","title":"Thinkact: Vision-language-action reasoning via reinforced visual latent planning.arXiv preprint arXiv:2507.16815, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.646504Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d9046631be1113686fe21c79c8ac687a884f97316b83685185183d82071b2355","observation_id":"af79a83f-36a9-4fd3-8793-92bff4195851","resolution":{"observed_at":"2026-08-03T06:50:19.646504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:19.764848Z","title":"Deepmvs: Learning multi-view stereopsis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.764848Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:38658ff488b9768313fa265f63f316a060ef021717a085ec9bb2eec7643cb8d7","observation_id":"afa3bcb0-d33a-4c0d-b2db-02560f51191a","resolution":{"observed_at":"2026-08-03T06:50:19.764848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-03T06:50:19.954736Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:19.954736Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:cebc1c54a4f149c2290d7ae9edc6ce98f6e3fce5ed8ef189ce311f688ec44021","observation_id":"c16d699b-14ee-4744-9158-966e23314739","resolution":{"observed_at":"2026-08-03T06:50:19.954736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T06:50:20.034739Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.034739Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:cca1fdc39e30098d1646198e781f8aab3a607e82057799f4776563b55fa861e8","observation_id":"0562eaba-0f2b-4b0e-8b05-25fcfd523f1a","resolution":{"observed_at":"2026-08-03T06:50:20.034739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.112957Z","title":"Perspective fields for single image camera calibration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.112957Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:79ce0d703a808e29335521978c48d5571ae004c957810b3617f3a19cb4dc082f","observation_id":"5f5a9b5d-79eb-4469-a937-04848eb95275","resolution":{"observed_at":"2026-08-03T06:50:20.112957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.185658Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.185658Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:dccc7fe0abffe2c3cb52b820f2dcf938df177a17fdc4fc272fb92e774824d237","observation_id":"03ea1b76-5801-4294-b4f0-ad62eb608131","resolution":{"observed_at":"2026-08-03T06:50:20.185658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-08-14T05:03:26.544771Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-08-03T06:50:20.258449Z","title":"MapA- nything: Universal feed-forward metric 3D reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.258449Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:5990e8f4332e8af1eeec16cdb4e3b5a32102cd986a3a43769efda90871337ef3","observation_id":"afc43c63-e846-4dd7-a617-978ad8855d52","resolution":{"observed_at":"2026-08-03T06:50:20.258449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-03T06:50:20.317875Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.317875Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:efa29d337ea7d4458c701ad31b86cd0740db9af27a7910edafa9cd76cac46246","observation_id":"65728406-6aed-4993-8eab-47e1342af673","resolution":{"observed_at":"2026-08-03T06:50:20.317875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.453626Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.453626Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:c451f0cc36928d707af97d0ed1af411ef4c5cf0e7bb6d50977c47a6dd4c009ee","observation_id":"5ae91015-3835-4e46-9f20-cfae69039cc2","resolution":{"observed_at":"2026-08-03T06:50:20.453626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.539440Z","title":"Evaluation of cnn-based single- image depth estimation methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.539440Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6ca8635d3066b9fb5abe92c5d004f7bb6a1348247331cd0b507656d6f1a06822","observation_id":"dd8695e7-7cd6-4aaa-8c99-0850ccb081b7","resolution":{"observed_at":"2026-08-03T06:50:20.539440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.597544Z","title":"Pulling things out of perspective","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.597544Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:cedd139bd528daf1ce50ae9ef291f1002c1dd0da3e6e46c77f0093e4de610f5b","observation_id":"1a037025-deed-481c-b34a-05ab21461645","resolution":{"observed_at":"2026-08-03T06:50:20.597544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.689475Z","title":"Deeper depth prediction with fully convolutional residual networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.689475Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:09e29b058f0a340b108ce1695b11971ea5ebaf0e985e6f73e30b763987d68484","observation_id":"ad70ca40-903f-4b65-a076-02ef42233fcc","resolution":{"observed_at":"2026-08-03T06:50:20.689475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-08-14T09:44:01.476519Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-03T06:50:20.765971Z","title":"Molmoact: Action reasoning models that can reason in space.arXiv preprint arXiv:2508.07917, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.765971Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:c989757a5a46d8ed643e0e5db5c878cc3f5e34fad6cd1f15b1931916bdefe0e0","observation_id":"9e3781d9-bde6-4ae5-8ed2-6bb998a3044d","resolution":{"observed_at":"2026-08-03T06:50:20.765971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.834831Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.834831Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:0222aa572ab5da158c24c6dc35e4cdffdee06158fa3bf538ad02139543029322","observation_id":"fc654eac-d8fa-4158-9ff4-499018458e92","resolution":{"observed_at":"2026-08-03T06:50:20.834831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T06:50:20.909404Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.909404Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e92711d79e84cfaf5cbaf9e60cee1494be56b3528fc7008c1512e4457f1a25fa","observation_id":"bba93498-c49e-4ada-ab89-7aca288dd47b","resolution":{"observed_at":"2026-08-03T06:50:20.909404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:20.974859Z","title":"Radarcam-depth: Radar-camera fusion for depth estimation with learned metric scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:20.974859Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:23ef678c288c78cbb1dcbdc8ea9a67112d54251e3c92ddb20dc1d0bd34a7dee9","observation_id":"703fdc8c-b012-4d00-b0c5-60c62405500c","resolution":{"observed_at":"2026-08-03T06:50:20.974859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.073279Z","title":"Sparse beats dense: Rethinking supervision in radar-camera depth completion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.073279Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e37892d1cb4f943be412eff7a238590b69b8845247dcb45cd3a55f0b47b15304","observation_id":"41e1c7fc-f633-4bea-bb5c-bd11c35873b3","resolution":{"observed_at":"2026-08-03T06:50:21.073279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.196071Z","title":"Matrixcity: A large-scale city dataset for city-scale neural rendering and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.196071Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d47390d4aba0596077045cf752edd6005c2fbe1519daf53e2ef392e7eefa563a","observation_id":"1158a2be-f2f8-4dc3-b8b6-2ceec29ce052","resolution":{"observed_at":"2026-08-03T06:50:21.196071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.298085Z","title":"Megadepth: Learning single-view depth prediction from internet photos","venue":null,"work_id":null,"year":2041},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.298085Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:6aa5454fd7e2985b173c72473039457986baee57ac012b620526004b82e80fd7","observation_id":"6fc01bca-25fb-4dee-82cf-c84c348995e7","resolution":{"observed_at":"2026-08-03T06:50:21.298085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.409327Z","title":"Patchfusion: An end-to-end tile-based framework for high-resolution monocular metric depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.409327Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:28e7b26057e0601db413ba6db75a7f163ce1c4ac16b2edfc9636f1168e18b8a1","observation_id":"1cc349c2-4c3b-4b67-b259-4c301fb34d45","resolution":{"observed_at":"2026-08-03T06:50:21.409327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-03T06:50:21.554913Z","title":"Chen, Zhenyu Li, Guang Shi, Jiashi Feng, and Bingyi Kang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.554913Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:65479b90e719a7eab618e2e63f1bb9eac0542e2614bf2e6bd804deb9d9f51f7d","observation_id":"dcd18594-38e8-4e24-a5e3-42f1ef6719d4","resolution":{"observed_at":"2026-08-03T06:50:21.554913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.673520Z","title":"Prompting depth anything for 4k resolution accurate metric depth estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.673520Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:98b6bd858ea9180f248548457d8b7c72e535636bafc2dc19832d7a4ad1e88489","observation_id":"dd2d8df1-3997-41e7-a376-a1b7c2d5736d","resolution":{"observed_at":"2026-08-03T06:50:21.673520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.786096Z","title":"Vila: On pre-training for visual language models.2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 26679–26689, 2023","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.786096Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:cf338489936e30a91dc1925a485e3d719e70b712673f35939daf1f1e20f4b538","observation_id":"9c4a9b03-34ef-4e85-b9f4-aadb13701a0d","resolution":{"observed_at":"2026-08-03T06:50:21.786096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.846820Z","title":"Depth estimation from monocular images and sparse radar data","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.846820Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:64d027dfb4fbcac13504de7927cfefec4d362dc1d7cd0c8bd8a2db15e35f4f1b","observation_id":"e96992eb-d19d-4c80-b3a4-a4a3cbabd434","resolution":{"observed_at":"2026-08-03T06:50:21.846820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:21.932511Z","title":"Libero: Bench- marking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Sys- tems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:21.932511Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:2d2bf00853a4088bea5f6e506ebdb966a3237d6e49689f338be6ed01f823abd5","observation_id":"2efcc26c-5a29-4ac4-9bdc-ec76d683fe1b","resolution":{"observed_at":"2026-08-03T06:50:21.932511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.042204Z","title":"Depthlab: From partial to complete.arXiv preprint arXiv:2412.18153, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.042204Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:f81b5f6b1efc72694302db919c5cf13d772839afc93ad0987d618919286aa441","observation_id":"9f0a8311-59e5-4d31-bd42-81c154a2b466","resolution":{"observed_at":"2026-08-03T06:50:22.042204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.192327Z","title":"Depth estimation from monocular images and sparse radar using deep ordinal regression network","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.192327Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:3a7ffbf0510726d12f892739d6ee2057fdb1cd9227408dfb57c19ea960a38d17","observation_id":"e231b1ca-a92f-48d2-ac33-aa84cb07cb9b","resolution":{"observed_at":"2026-08-03T06:50:22.192327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.376684Z","title":"Rcdpt: Radar-camera fusion dense prediction transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.376684Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:207fe0d6b4a3d8306328e2d02846481157c7758dbf9ce3325e458a17de5cb2e4","observation_id":"e2b52a09-ef91-484d-915a-1381dee8ff21","resolution":{"observed_at":"2026-08-03T06:50:22.376684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.468554Z","title":"Radar-camera pixel depth association for depth completion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.468554Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:44bbde860573222e7d06321f6749318d09f93a17cc2ede100208bfc54c998f2e","observation_id":"37467fb8-5a39-4935-a893-87fb0936a055","resolution":{"observed_at":"2026-08-03T06:50:22.468554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.599349Z","title":"You see it, you got it: Learning 3d creation on pose-free videos at scale","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.599349Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:00e3b3b39fb64736fd378ae3a3ab4aa6fc85516e5eabb2954ef0f8b2568bd706","observation_id":"e818e544-f198-4c9d-8818-38a977c8169b","resolution":{"observed_at":"2026-08-03T06:50:22.599349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.639772Z","title":"Spring: A high- resolution high-detail dataset and benchmark for scene flow, optical flow and stereo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.639772Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:0bc803500d9bab159078949f431dd349b003eaa740e920bb1f5ffa774b693e7c","observation_id":"50ee0b70-d170-4147-9658-ce1c2ad70f92","resolution":{"observed_at":"2026-08-03T06:50:22.639772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-03T06:50:22.714828Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.714828Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:a830d1fc6c2cb09966e2df97f761113671598208b5f219a830d87e0786f1c814","observation_id":"4349758f-d64f-4060-bcfe-8296844e562a","resolution":{"observed_at":"2026-08-03T06:50:22.714828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.776114Z","title":"Depth prompting for sensor-agnostic depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.776114Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:b9a61f038bc70c0de8d0abc0059d16655725dc690b6b333d8faf21f9010add18","observation_id":"d0157747-8559-4b2b-9fa1-dc2e693e22d2","resolution":{"observed_at":"2026-08-03T06:50:22.776114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:22.846657Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.846657Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:8cc563908a21193f564e225595856915d803ab501729057f06076ab1218646cc","observation_id":"e56f5475-a9fb-475b-a236-1c2f77b735ac","resolution":{"observed_at":"2026-08-03T06:50:22.846657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-03T06:50:22.904022Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.904022Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:7be184b1a5af75a9b5259453485910eb49d92a6f8f5c4c854266834e0aaefba1","observation_id":"9c8d4159-35f2-4fb4-848f-eb7f6e40c2e7","resolution":{"observed_at":"2026-08-03T06:50:22.904022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-08T08:28:09.948334Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-03T06:50:22.944096Z","title":"Unidepthv2: Universal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:22.944096Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:3e51745d2822d7902d35dd4b959aac79f4a7dfff4f510bd55239ef634b8c426a","observation_id":"0d8622b5-ba42-4923-92f2-71cae114caec","resolution":{"observed_at":"2026-08-03T06:50:22.944096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.041082Z","title":"Unidepth: Universal monocular metric depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.041082Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:34f28262a2d5ff5b361c30bcf05d510abfefbca566533d950e2e8d60d5d9e7d3","observation_id":"6d7f6894-3d7a-492b-b415-2d2205a7404b","resolution":{"observed_at":"2026-08-03T06:50:23.041082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-03T06:50:23.187586Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.187586Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:ce416ef3e81a22e9af9347fc16ca4df80611cc9c0f2e0df59061c48afd682592","observation_id":"f475612a-16e3-40b6-ad7f-c120a4c0ebef","resolution":{"observed_at":"2026-08-03T06:50:23.187586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.252580Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.252580Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:b3a2314bc3114279234a96e9a7db3f5214d5c005012c8b1e241c3d0369face62","observation_id":"30b0b3cf-35d7-4328-a3c5-1de00442289c","resolution":{"observed_at":"2026-08-03T06:50:23.252580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-08-13T05:49:42.416742Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-08-03T06:50:23.343293Z","title":"Habitat-matterport 3d dataset (hm3d): 1000 large-scale 3d environments for embodied ai.arXiv preprint arXiv:2109.08238, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.343293Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:f1615e7bd86d422697e9d251dd51f83e6e5255efa42e997daf1a08bd9c2dec12","observation_id":"add59cf4-0a10-4304-9171-84a0f8de3a0c","resolution":{"observed_at":"2026-08-03T06:50:23.343293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.399233Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.399233Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:5c1edc277957e08e401b9d5393501a849577e65cb6d6cfa0d907fc7d3a824133","observation_id":"c02b3b95-d226-4c00-b60e-e8a9cc213b04","resolution":{"observed_at":"2026-08-03T06:50:23.399233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.479270Z","title":"Booster: a benchmark for depth from images of specular and transparent surfaces.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46(1):85–102, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.479270Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:bc6dc64abc21cfde5b5d33c3b98c0d180d2568849eff925da8d2bcb561ef8b32","observation_id":"7c8632c3-6117-4f8b-bfb5-5d3de91f25a8","resolution":{"observed_at":"2026-08-03T06:50:23.479270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.601706Z","title":"Vision transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.601706Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:110412eb37c17df6c7fc42c1a86f6ecf1eb27c4fae369b999559b883e7edacdc","observation_id":"445c3306-4f12-4bff-9c4d-10166b56fa25","resolution":{"observed_at":"2026-08-03T06:50:23.601706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.665852Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.665852Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:3211fd922295f5d97cebb5bd1e8cde73670ef3224f9f2f8f91bfdcd12b242e6f","observation_id":"25c368cc-f6a5-4b82-b1a3-11903c600d62","resolution":{"observed_at":"2026-08-03T06:50:23.665852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.745198Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.745198Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e43c11b35e04ad8f72c2864489fc7f2e51e2ad9a4fd6d945e7820d6b182c1ee7","observation_id":"de376240-bf18-45fe-bdda-669292b73810","resolution":{"observed_at":"2026-08-03T06:50:23.745198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.822950Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.822950Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d442631f6194a8dc7d198d0aa91b7c0bbb6f330d92fbd67a538252dad2a4fde3","observation_id":"644c208e-0544-44ed-ba73-e66ae211fae7","resolution":{"observed_at":"2026-08-03T06:50:23.822950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:23.957891Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:23.957891Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:28674d0e954dbe597227c001fa0352055a2572037fc219be4d421966d4d638d5","observation_id":"d705fb3b-da33-4d45-8810-d1457db9094b","resolution":{"observed_at":"2026-08-03T06:50:23.957891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.052933Z","title":"The synthia dataset: A large collection of synthetic images for semantic segmentation of urban scenes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.052933Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:dc08acb179004c249303d1536824c37d00ee821d2d114abfe9dec272ba15f8ce","observation_id":"719367b6-8e75-4ae4-b9b3-7a30b3e3d366","resolution":{"observed_at":"2026-08-03T06:50:24.052933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.153633Z","title":"Numerische Isotropieoptimierung von FIR-Filtern mittels Querglättung","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.153633Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:cdb3bd2a69afa21368857d401f3ab157373532625fc6bc9e89793bb82941e29f","observation_id":"a5e64b72-86c5-4b1e-9714-d7de5243b8d8","resolution":{"observed_at":"2026-08-03T06:50:24.153633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.227471Z","title":"High-resolution stereo datasets with subpixel-accurate ground truth","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.227471Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d567cfba251faa05a8f92ff10cc7b60de11ea84f026ddc56deafe413429ec733","observation_id":"41bf1b8d-aefc-4042-a366-bcc4c525cdaa","resolution":{"observed_at":"2026-08-03T06:50:24.227471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.350000Z","title":"Schönberger, Silvano Galliani, Torsten Sattler, Konrad Schindler, Marc Polle- feys, and Andreas Geiger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.350000Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:1b010d52b7996972bc77a875f9a3bfc4add39ef5cd83c592934eb5a89fbaa2b2","observation_id":"c804757b-64f5-47e0-b243-9ef888dd2bf7","resolution":{"observed_at":"2026-08-03T06:50:24.350000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.442501Z","title":"A multi-view stereo benchmark with high-resolution images and multi-camera videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.442501Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d9e6b73087cc5091eaea0f6d0de1ca6c6ee5f0a20cac2892d6d533c39c583d7d","observation_id":"04599f7b-38bb-4b29-aa41-a34bf404455a","resolution":{"observed_at":"2026-08-03T06:50:24.442501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.624908Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.624908Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:d4c58bb59f210491ffbe6039c35ae553a14a3392926e71a93106d6a6ef3434b8","observation_id":"2f58b818-16a4-4ec2-9496-cdc900cc406a","resolution":{"observed_at":"2026-08-03T06:50:24.624908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-03T06:50:24.779427Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.779427Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:c050b4e5331ab902f8a7beee99c4dde8a9f99ee10b8e8d6ff32756028c938929","observation_id":"51e8d30c-4c30-4189-9c3d-0d338512ed80","resolution":{"observed_at":"2026-08-03T06:50:24.779427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:24.917228Z","title":"Depth estimation from camera image and mmwave radar point cloud","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:24.917228Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:7cd18a089458d2b645e942d95663bac0bce3b8b6b6012ba8b03ac87c4431f2e4","observation_id":"64dd60e5-751d-4719-a817-e4a8c22f0937","resolution":{"observed_at":"2026-08-03T06:50:24.917228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.025637Z","title":"Sun rgb-d: A rgb-d scene understanding bench- mark suite","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.025637Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:0620dc6bd48ecb264c6214c7d0f02a94baa65eff90946376c67a4f734b5ea9e3","observation_id":"0086bf5d-ce95-429d-94aa-5e73a1e9cdcf","resolution":{"observed_at":"2026-08-03T06:50:25.025637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.05797","last_updated":"2019-06-13T16:29:58Z","snapshot_observed_at":"2026-08-01T13:51:16.469557Z","submitted_at":"2019-06-13T16:29:58Z","title":"The Replica Dataset: A Digital Replica of Indoor Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.05797","snapshot_observed_at":"2026-08-03T06:50:25.206963Z","title":"The replica dataset: A digital replica of indoor spaces.arXiv preprint arXiv:1906.05797, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.206963Z"},"links":{"cited_paper":"/paper/1906.05797","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:df4b37a2f7d5b3cd0ebedc4e9f4877805d483c73c0f1cfe0e7674886bd57d9d3","observation_id":"9b1ce239-6f95-4b7c-bda8-1d5645d8c4fa","resolution":{"observed_at":"2026-08-03T06:50:25.206963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.350846Z","title":"Cafnet: A confidence-driven framework for radar camera depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.350846Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:98bb42ef48018bc5feef1813109893bcdfe81f5181aebe6e9db095dc5a38c321","observation_id":"f13270bf-c462-4b45-a195-0d782e2bc042","resolution":{"observed_at":"2026-08-03T06:50:25.350846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.498052Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.498052Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:e9a6eef1f7aa83909c15bf69daed1e21751a19ce0a3b8d1b3e18cb46fb21ef92","observation_id":"b59ceef3-ad3f-4a57-b410-cb7644d9ee3f","resolution":{"observed_at":"2026-08-03T06:50:25.498052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.618539Z","title":"The bitter lesson.Incomplete Ideas (blog), 13(1):38, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.618539Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:7dea482881f8554bf08bce5b2b98649e711e62f744ce128036b2f78fcff5108f","observation_id":"c2822f6f-4d5e-43ba-b4b7-7e56b5b3b1f2","resolution":{"observed_at":"2026-08-03T06:50:25.618539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.739325Z","title":"Masked depth modeling for spatial perception.arXiv preprint arXiv:2601.17895, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.739325Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:7885b472aa9c17467daf34a2ada5f6a96d5ca3fb045ebd8dd745d830c9dcf9f8","observation_id":"322d0f04-ffc3-41a3-91b7-0de1f9f3d26e","resolution":{"observed_at":"2026-08-03T06:50:25.739325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:50:25.838759Z","title":"Bilateral propagation network for depth comple- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.838759Z"},"links":{"citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:541e6aa41cbd99743522b741eb9641abfc6cd4aa6ebf4147ed69044bac0d8860","observation_id":"cf678807-442a-437e-b537-bdf2be3530d5","resolution":{"observed_at":"2026-08-03T06:50:25.838759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-03T06:50:25.905855Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:25.905855Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:881ded07d3097fb85e1fe30028e6631065ba915ca8a09cc99190c91907fe7493","observation_id":"72a3986e-1f6d-4899-8b15-fb818a8c85b2","resolution":{"observed_at":"2026-08-03T06:50:25.905855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T13:35:29.838915Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":139},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 139 outbound references and 4 inbound Pith citation observations for arXiv:2601.22054."}