{"as_of":"2026-08-14T08:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54668d946549a5d6f7d8bad854dfd592bcf770f2f7b9d2b4ae0e005c0d4197d8","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:31:01.975283Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:15:20.254402Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:24:02.091990Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"cited_work":{"arxiv_id":"2411.19189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19189","snapshot_observed_at":"2026-06-29T23:24:02.091990Z","title":"Video depth without video models.arXiv preprint arXiv:2411.19189, 2024","venue":null,"work_id":"560e09c4-d6c5-48f3-9784-5bbe1752ee45","year":2024},"citing_paper":{"arxiv_id":"2605.25308","last_updated":"2026-05-25T00:13:15Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T00:13:15Z","title":"Stabilizing Streaming Video Geometry via Dynamic Feature Normalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T23:15:20.254402Z"},"links":{"cited_paper":"/paper/2411.19189","citing_paper":"/paper/2605.25308"},"observation_digest":"sha256:7a00adbb82f26c0a32f464a19c328cfd52a0585dc84036663ef059e1a87e5b48","observation_id":"163a352c-fcf8-4785-b463-ba548262d900","resolution":{"observed_at":"2026-06-29T23:24:02.093483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19189/citation-record","integrity":"/paper/2411.19189/integrity","json":"/paper/2411.19189/citation-record.json","paper":"/paper/2411.19189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.621125Z","title":"Bidirectional attention network for monocular depth estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.621125Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:ab26a537d7aefd09dcaadba1b8deb2f974fcf43af50f12de1fcac3eba5b26fdf","observation_id":"507e7022-fdaf-4084-88b5-f9c5722ccc6e","resolution":{"observed_at":"2026-08-12T10:31:01.621125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.625444Z","title":"AdaBins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.625444Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:8e8fc526139957d772f2cc04f48cee5bda0938f85f538c5e8f3d8702c0c7d9a6","observation_id":"204de18b-90a8-4a39-8cea-91ab1ba0cd9b","resolution":{"observed_at":"2026-08-12T10:31:01.625444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-12T10:31:01.629852Z","title":"ZoeDepth: Zero-shot transfer by com- bining relative and metric depth","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.629852Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:c6a527d55bd21313db7f55415416a24bc5a00b6708a20fcff2b0119f8fc5fba6","observation_id":"1ab953cd-a1aa-4f3c-8a2c-1a1caa5a53f7","resolution":{"observed_at":"2026-08-12T10:31:01.629852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:31:01.634186Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.634186Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:85606eb63cca24a848b8ae67ff8a98ab04056cba376c1870b999c8f14ee29d33","observation_id":"75bbbc40-938c-48f2-979b-ed448ffca992","resolution":{"observed_at":"2026-08-12T10:31:01.634186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-12T10:31:01.639244Z","title":"Depth Pro: Sharp monocular metric depth in less than a second","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.639244Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:1ba54bbd560f9980a92d432382cf74ac2bbb327164f7ae5bc990249963445400","observation_id":"b9a9e055-e7eb-4c60-b1b9-fcb1c021889c","resolution":{"observed_at":"2026-08-12T10:31:01.639244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.643511Z","title":"Pix2Video: Video editing using image diffusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.643511Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:7b19b862061bb4eaa38e82dc8f552d995bfc320b3cd5faac5fed73683629acd9","observation_id":"1e554693-4b2d-4ed4-bd83-59bd4c5d1ebb","resolution":{"observed_at":"2026-08-12T10:31:01.643511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.647548Z","title":"Self-supervised learning with geometric constraints in monocular video: Connecting flow, depth, and camera","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.647548Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:12d4d86303e32cb95b711cf2c71f93cc1fb084aa3769560fa3f7f653a09fa94b","observation_id":"11d57d43-b082-48d9-8075-ab932d32cc00","resolution":{"observed_at":"2026-08-12T10:31:01.647548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.651830Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Niessner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.651830Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d4df7a1d10be42e2eeb51bbc611aee0af72ad4750a03c00c852fee278db7e4af","observation_id":"6829c104-18d1-4dac-87aa-366847d3ad27","resolution":{"observed_at":"2026-08-12T10:31:01.651830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.656010Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.656010Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:a709fb5fdc43bf1396d76014785f295781fe6b51c0afb86a64a761b884e0157d","observation_id":"f7b13c93-1053-488e-986c-b8b61c30a104","resolution":{"observed_at":"2026-08-12T10:31:01.656010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.659951Z","title":"Warped diffusion: Solving video inverse problems with image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.659951Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:036fa335a9b974153b7d2df1e3e5902cd0fca6451ce3e8b0e15e7841debbf7a1","observation_id":"0fdcab84-ca89-4c24-8f79-b2d7267b7803","resolution":{"observed_at":"2026-08-12T10:31:01.659951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05021","last_updated":"2023-08-29T05:20:36Z","snapshot_observed_at":"2026-08-13T12:28:39.344752Z","submitted_at":"2023-03-09T03:48:24Z","title":"DiffusionDepth: Diffusion Denoising Approach for Monocular Depth Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05021","snapshot_observed_at":"2026-08-12T10:31:01.664345Z","title":"DiffusionDepth: Diffusion denoising approach for monocular depth estima- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.664345Z"},"links":{"cited_paper":"/paper/2303.05021","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:eb394c208f7e1e568f6ae067bbcc536cc613873659b9d91549a68021ce980b9a","observation_id":"b82abd2c-4468-4e0a-8398-10b027644a9b","resolution":{"observed_at":"2026-08-12T10:31:01.664345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.668578Z","title":"Depth map prediction from a single image using a multi-scale deep net- work","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.668578Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d5aa9e364a48067748596e4804e0173509ed8be682ef4ae543274ff2aa2cd600","observation_id":"cfe8e210-1d49-439a-a892-b2b25ce751c7","resolution":{"observed_at":"2026-08-12T10:31:01.668578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:03.010213Z","title":"Deep ordinal regression net- work for monocular depth estimation","venue":null,"work_id":"9b8429fc-7f8f-4690-9f40-1edc98a1d62f","year":2018},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.672397Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:5b923c5751adad633b43e5ae7994d9b1780673643bdfa2d29bd9664d8dd9093f","observation_id":"60ad2e89-56ff-40b4-b4d5-10f499920978","resolution":{"observed_at":"2026-08-12T10:31:03.013999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.998249Z","title":"GeoWiz- ard: Unleashing the diffusion priors for 3d geometry estima- tion from a single image","venue":null,"work_id":"fbef0674-89a9-4058-98ce-f12f15390bae","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.676214Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:f2ea3a36900a75d30186ecaab6668adad077708c93e5b920b9b4fcb10d3b3ed2","observation_id":"c62ae05e-c8e3-41e5-9dec-ab40d8093018","resolution":{"observed_at":"2026-08-12T10:31:03.002314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.679964Z","title":"Multi-view stereo: A tutorial","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.679964Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:fcd70d5ea8a3ec622f8e48e5523c3a2af855289bdc0e8c486d77953e1f93d0b2","observation_id":"952a6f5c-9836-4b1f-af69-3721799602e4","resolution":{"observed_at":"2026-08-12T10:31:01.679964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.683906Z","title":"Fine-tuning image-conditional diffusion models is easier than you think","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.683906Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:9bd4ac685d776328475b1fc5ad76099ce5fd3971edeec3f65379c0f8cca2b0ab","observation_id":"40640050-410c-421b-8f50-23ac2eee121b","resolution":{"observed_at":"2026-08-12T10:31:01.683906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.979027Z","title":"AliceVision Meshroom: An open- source 3d reconstruction pipeline","venue":null,"work_id":"fa6b3a33-b151-4793-a9ac-7b3a101988f6","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.687574Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:37b884abe9680ed53421767b7e6f1b117403542426a637c06c89697ee7966d9d","observation_id":"d6ee4879-9902-4fcf-8e99-c9ae7a550b04","resolution":{"observed_at":"2026-08-12T10:31:02.983143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13788","last_updated":"2024-12-19T17:51:42Z","snapshot_observed_at":"2026-08-13T00:49:16.784722Z","submitted_at":"2024-03-20T17:51:53Z","title":"DepthFM: Fast Monocular Depth Estimation with Flow Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13788","snapshot_observed_at":"2026-08-12T10:31:01.691346Z","title":"DepthFM: Fast monocular depth estimation with flow match- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.691346Z"},"links":{"cited_paper":"/paper/2403.13788","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:9c46d53f5690d70f18aec4e4bf64bbdc3927cd13e522629428733a20dcdb20b7","observation_id":"22feaac2-643b-48ef-9212-fff47be37735","resolution":{"observed_at":"2026-08-12T10:31:01.691346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.967126Z","title":"3d packing for self-supervised monocular depth estimation","venue":null,"work_id":"baece274-db46-45c5-bf55-08e7753669e8","year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.695822Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:b030c346036f379b6c9d4907be233d6b2faca1f0fd00f84f36967cd4986af855","observation_id":"435fd2d8-7dcd-49a0-908e-1f7b79d138f9","resolution":{"observed_at":"2026-08-12T10:31:02.971137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.954673Z","title":"Towards zero-shot scale-aware monoc- ular depth estimation","venue":null,"work_id":"090dfcf7-4464-4a73-84fd-59b2687da5a2","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.699642Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:ffd1b9b5f38c4696e06adcc7c431bfdfa3ef7045a513255a08cf2e32cf50b01b","observation_id":"ff25ae2c-843c-42cd-a2b6-92a68d290066","resolution":{"observed_at":"2026-08-12T10:31:02.959016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-12T22:36:38.511678Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-12T10:31:01.703813Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.703813Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:fce9e83b9c8b3405915a730f9a36a7eae72015d550c162e3e26b5002480b00c8","observation_id":"862a587c-9c33-450c-b771-d1576e9dc811","resolution":{"observed_at":"2026-08-12T10:31:01.703813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.707761Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.707761Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:59f0ef4ab775d9b5e0e55e5494666d7120a84470fdd01442085711897f6849da","observation_id":"4f34e0e8-3cdf-49a8-9e8a-5117ac170b38","resolution":{"observed_at":"2026-08-12T10:31:01.707761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15506","last_updated":"2025-01-03T15:39:16Z","snapshot_observed_at":"2026-08-13T07:17:16.417419Z","submitted_at":"2024-03-22T02:30:46Z","title":"Metric3Dv2: A Versatile Monocular Geometric Foundation Model for Zero-shot Metric Depth and Surface Normal Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15506","snapshot_observed_at":"2026-08-12T10:31:01.711328Z","title":"Metric3D v2: A versatile monocular geomet- ric foundation model for zero-shot metric depth and surface normal estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.711328Z"},"links":{"cited_paper":"/paper/2404.15506","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:b737037a7148115cdf7798f6bf1c61854f748019a0ee2a4f48e108d76f40d815","observation_id":"4c04a0b5-1a9d-448a-ac4d-eca2b0ac8199","resolution":{"observed_at":"2026-08-12T10:31:01.711328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-12T22:52:07.327467Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-12T10:31:01.715293Z","title":"DepthCrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.715293Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:45549cd47ed014e47da3acfbff9c6146765a6a0b80572ab8041bbff4645dc214","observation_id":"34e551eb-4817-44e1-92bf-6c88593ff22c","resolution":{"observed_at":"2026-08-12T10:31:01.715293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.935286Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"fd2642b4-a08c-482f-ae91-84967a6542dc","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.719107Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:c82e6d6e7ddeb46c8608415da0f492cf1d7f59bc0620fcc4a7b32467e40feb89","observation_id":"e8561de6-6fe2-41b2-a210-212a9823cac0","resolution":{"observed_at":"2026-08-12T10:31:02.939756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.922868Z","title":"3d Gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"a9511d56-06fa-48fb-8151-69257a92d6e7","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.722828Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:f531873e6dbb72cfa3d41ff205f6d429f05f0da02442a3219d60d09c2baf6a7a","observation_id":"fd429453-75fd-4c59-825c-c08c4c19135e","resolution":{"observed_at":"2026-08-12T10:31:02.927041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.911055Z","title":"Text2Video-Zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"e54f9aec-aea0-4baf-b716-6793010f6814","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.726671Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:cc33146839563a9e70364657bb7867cfedca936e1c54bf32f1bc811cc32af2bc","observation_id":"a67928a0-0eed-4e55-a7ae-720c6e0b10ad","resolution":{"observed_at":"2026-08-12T10:31:02.915224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.897353Z","title":"EscherNet: A generative model for scalable view synthesis","venue":null,"work_id":"fb4c9534-212d-4cab-a6d4-9d4174a2e698","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.730724Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:c3032a204ed2cd8ecc1678eb4cd9e39e98c3f1b3aba4263381b95d7ce201ffbb","observation_id":"e8225162-637c-416d-b9d3-864408c7f9a1","resolution":{"observed_at":"2026-08-12T10:31:02.901859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.882244Z","title":"Robust consistent video depth estimation","venue":null,"work_id":"cf81bd3c-e6be-4fd0-bd1f-2a29e97116cd","year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.735055Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:7ba7ecd286ca7a610d20eb16cee41523ff813cfe3a11511c9c18066fd6660153","observation_id":"9bbbb42c-cefa-4371-8225-c70b9d9647fa","resolution":{"observed_at":"2026-08-12T10:31:02.886932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02574","last_updated":"2025-02-27T09:04:08Z","snapshot_observed_at":"2026-08-12T22:51:39.970901Z","submitted_at":"2024-09-04T09:48:27Z","title":"Solving Video Inverse Problems Using Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02574","snapshot_observed_at":"2026-08-12T10:31:01.738592Z","title":"Solving video inverse problems using image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.738592Z"},"links":{"cited_paper":"/paper/2409.02574","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:666c8268ed52ec8e9354708c341c609f84ed635659802823b3458014aab0a34e","observation_id":"f87ee3bb-adc8-4bb9-aa32-f7a57d5d3b0e","resolution":{"observed_at":"2026-08-12T10:31:01.738592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10326","last_updated":"2021-09-23T10:23:51Z","snapshot_observed_at":"2026-08-13T06:28:42.291195Z","submitted_at":"2019-07-24T09:31:24Z","title":"From Big to Small: Multi-Scale Local Planar Guidance for Monocular Depth Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10326","snapshot_observed_at":"2026-08-12T10:31:01.742634Z","title":"From big to small: Multi-scale local planar guidance for monocular depth estimation","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.742634Z"},"links":{"cited_paper":"/paper/1907.10326","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:24d99737615654dd20d704b80fc2572396420ce513f1506024ca145da6ab2d4e","observation_id":"380c524c-704b-4acb-ba37-ba04eea4b98f","resolution":{"observed_at":"2026-08-12T10:31:01.742634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.868042Z","title":"MegaDepth: Learning single- view depth prediction from internet photos","venue":null,"work_id":"6d11d5ad-f736-4c3e-9a24-efda09f95077","year":2018},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.746844Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:aa1ce1bf669b1b8704160dbbb8590a06b266b4da7293bc757e13b45d449491d1","observation_id":"d8f62468-4713-4128-b130-07e087c01a4e","resolution":{"observed_at":"2026-08-12T10:31:02.872664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00987","last_updated":"2022-04-03T04:38:02Z","snapshot_observed_at":"2026-08-13T16:09:37.639399Z","submitted_at":"2022-04-03T04:38:02Z","title":"BinsFormer: Revisiting Adaptive Bins for Monocular Depth Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00987","snapshot_observed_at":"2026-08-12T10:31:01.750683Z","title":"BinsFormer: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.750683Z"},"links":{"cited_paper":"/paper/2204.00987","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d44198a7493cd243b8a8612858db40cbcbfd8b04f8a9b7bd1984b80c6dd727db","observation_id":"eabffd05-2720-4d0c-bf5c-9f3cb901bc34","resolution":{"observed_at":"2026-08-12T10:31:01.750683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.853406Z","title":"DepthFormer: Exploiting long-range correlation and local information for accurate monocular depth estimation","venue":null,"work_id":"01344d3b-8296-48b0-820a-79e8d5a5e366","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.755108Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:fa51e43ec2eb1f8346dc993ecd624660bf7608d0b1066e3b8faffe07cf325d72","observation_id":"b7fa91fa-e083-4195-ac68-b31b3b90d185","resolution":{"observed_at":"2026-08-12T10:31:02.858021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.840840Z","title":"Temporally consistent online depth estimation in dynamic scenes","venue":null,"work_id":"1ac10006-0cf0-410f-9a37-bb52d94d65e6","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.759587Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:66d9750bc08520fd68415a5f51580b422d981360bfa36dc98a35738dccd9fd96","observation_id":"481c72b1-cec9-468c-86de-c1b221da4619","resolution":{"observed_at":"2026-08-12T10:31:02.845020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.828162Z","title":"Patch- Fusion: An end-to-end tile-based framework for high- resolution monocular metric depth estimation","venue":null,"work_id":"512243bc-f4c5-4a31-b1bd-fc942e7d2cb4","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.763665Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:ff3d59d00acbc4a0e1c9e6e94df5d666f468d9c26d3a2c9ca9d5f3217d7f8800","observation_id":"f9ebe0e3-dfb4-44f5-b95d-fc5cc9f4b944","resolution":{"observed_at":"2026-08-12T10:31:02.832504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.816253Z","title":"PatchRe- finer: Leveraging synthetic data for real-domain high- resolution monocular metric depth estimation","venue":null,"work_id":"0b8a0778-c80e-4c1a-bf98-888a681ce2bc","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.767980Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:4e2dccf5c038223bcf8372657c23383f1d152783025f5c590462cb62657becd3","observation_id":"d64d3662-0bb2-4520-af55-3763bba33551","resolution":{"observed_at":"2026-08-12T10:31:02.820438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.803512Z","title":"Common diffusion noise schedules and sample steps are flawed","venue":null,"work_id":"43efefb1-d12f-4458-af4c-c25f3b8637fb","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.772663Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:7bc5be0452b90a43e31c0b8076065a08dda961b8a846c2c89e5d52a2ebdd5e2b","observation_id":"ad86ee3f-4ea5-408c-a561-38c47e2393cd","resolution":{"observed_at":"2026-08-12T10:31:02.808032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.789767Z","title":"V A-DepthNet: A variational approach to sin- gle image depth prediction","venue":null,"work_id":"40bae541-8ae4-41d0-aea0-cbba5181ca51","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.776864Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d8cfbe58458f9f3f601b667ed7038424b4ae6e3efbf46154d0e60b721deae710","observation_id":"e08582c1-c91b-41fa-9d3e-b2392fe6da4c","resolution":{"observed_at":"2026-08-12T10:31:02.794253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.774353Z","title":"Video-P2P: Video editing with cross-attention control","venue":null,"work_id":"b4b93397-c2fe-4ce3-9133-449afb1e56a2","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.781319Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:5d913b011520207f1c591f558de8e7e5d40d88b1e6dc909de0e951037411754e","observation_id":"ea80b74e-2656-48ed-86f5-41870ada40b8","resolution":{"observed_at":"2026-08-12T10:31:02.778536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03453","last_updated":"2024-04-15T10:28:44Z","snapshot_observed_at":"2026-08-12T22:52:54.817720Z","submitted_at":"2023-09-07T02:28:04Z","title":"SyncDreamer: Generating Multiview-consistent Images from a Single-view Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03453","snapshot_observed_at":"2026-08-12T10:31:01.785289Z","title":"SyncDreamer: Gen- erating multiview-consistent images from a single-view im- age","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.785289Z"},"links":{"cited_paper":"/paper/2309.03453","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:e6e58a960e486e054fa4ea7f657919aed2d79382c37987dfe6eef91ccda46c19","observation_id":"2af15d2e-7aee-494f-9ff5-b44e70f2dc13","resolution":{"observed_at":"2026-08-12T10:31:01.785289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.789391Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.789391Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:81c63074520d7d07265c58419f300b198146131c6639a55d743bebe8b7dfc034","observation_id":"9be976d2-92a6-4e6e-9e8a-32cedc83b05b","resolution":{"observed_at":"2026-08-12T10:31:01.789391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.754412Z","title":"Consistent video depth estimation.ACM Transactions on Graphics, 39(4), 2020","venue":null,"work_id":"5bb4f2c6-7ec5-4133-97fb-5076e530d51d","year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.793484Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:41dc39897d9bde435bfb2a065ef7f95daee7128d91182047738e8c6ebc5f9729","observation_id":"3e086bdf-840e-4fe8-b9fd-8ab3d8323262","resolution":{"observed_at":"2026-08-12T10:31:02.758481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.797151Z","title":"NeRF: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.797151Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:5a96c1f264525c8deac6b055215845bd388ee98ded42827e4f61fcaf89976007","observation_id":"2c6974da-0113-444c-bd31-ca9e15c17c33","resolution":{"observed_at":"2026-08-12T10:31:01.797151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.735390Z","title":"All in tokens: Uni- fying output space of visual tasks via soft token","venue":null,"work_id":"603cab8c-15c0-49b0-8fd1-d4681cd45b89","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.800748Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:baf898d2dad0904bc8cd62fcbc9959c53d188c5d6705b4b938ad738ca3ba9a50","observation_id":"8fcb55ee-7cea-4a89-ad43-05c5ab084d2e","resolution":{"observed_at":"2026-08-12T10:31:02.739508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-12T10:31:01.804394Z","title":"DINOv2: Learning robust visual features without supervi- sion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.804394Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:694ce84e682b03fb1bd68581667b044a8dc129657bb70afbcc797aee7e85b32a","observation_id":"c2f00492-7546-43d7-9bdb-3708338816a4","resolution":{"observed_at":"2026-08-12T10:31:01.804394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.722888Z","title":"ReFusion: 3d reconstruc- tion in dynamic environments for RGB-D cameras exploit- ing residuals","venue":null,"work_id":"4457e01e-bb11-4cd7-852b-c13d6e90afe6","year":2019},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.808185Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:b2a6656728a88cf3bae8a8976ac3733bd57af3bf017fbae61f38466e2bf949f6","observation_id":"38b7728a-73cd-40ae-af85-7a841339a714","resolution":{"observed_at":"2026-08-12T10:31:02.727163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.710410Z","title":"P3Depth: Monocular depth estimation with a piecewise planarity prior","venue":null,"work_id":"5fa89dec-23a6-4aa2-aa11-65477ceb7a86","year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.811873Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:bea8a06b8c600575214d4fa9a1b5fcd60a28bfacea5c93657c391f40461a7486","observation_id":"d49004a7-ec77-4ef3-af93-f532648ede2a","resolution":{"observed_at":"2026-08-12T10:31:02.714725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.815699Z","title":"UniDepth: Universal monocular metric depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.815699Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:e05dbe8025f9fdb9c603137ab30f1c5db8ec89079900cdcda3a8638ac16cb60c","observation_id":"e7e2d022-3458-4da9-a0d2-451a6a01bb24","resolution":{"observed_at":"2026-08-12T10:31:01.815699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-08T08:28:09.948334Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-12T10:31:01.819538Z","title":"UniDepthV2: Universal monocular metric depth estimation made simpler","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.819538Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:a1aff699d38468a1d8480b7c3051762df8a08d47f3e26c7ab41871315ed60d19","observation_id":"c4d69034-2dee-4d07-8773-7a0640579482","resolution":{"observed_at":"2026-08-12T10:31:01.819538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.689878Z","title":"FateZero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":"53b6b1a4-5299-41af-8dd5-a2f8d7824749","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.823762Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:fdb63a8523b8194c7b5121645e37d0797859b1ce20293babd5b992957d07d81b","observation_id":"f12d81f2-dcf5-47c4-948f-4d4f11cf43e8","resolution":{"observed_at":"2026-08-12T10:31:02.694337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.677436Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"04ca1e10-e9e2-4f5e-9378-24e8c0d734e7","year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.827426Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:0f27fca1dc0ee8392fca58d599585f0014744d22186e01745702132f999906ed","observation_id":"92630959-ae0c-4582-9385-b03606a3ffbf","resolution":{"observed_at":"2026-08-12T10:31:02.681680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.664677Z","title":"Susskind","venue":null,"work_id":"dc57f1a5-ebe0-4ca6-8c8a-13f8e1cd4815","year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.831122Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:33d6cc67b8298afbc4d4289e239d24cfeef44f42001b03641e330146e79ef8d1","observation_id":"997222fb-748c-42a3-a83b-44b755b595e9","resolution":{"observed_at":"2026-08-12T10:31:02.668767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.834637Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.834637Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:6b5bafc1c09f37513622e6b1b9cccc834e18518213179ea2d8a1bd49d331036b","observation_id":"c4065ab6-b964-44a3-bf10-e06634455472","resolution":{"observed_at":"2026-08-12T10:31:01.834637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14816","last_updated":"2023-02-28T18:08:21Z","snapshot_observed_at":"2026-08-13T12:34:58.634833Z","submitted_at":"2023-02-28T18:08:21Z","title":"Monocular Depth Estimation using Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14816","snapshot_observed_at":"2026-08-12T10:31:01.838842Z","title":"Monocular depth estimation using diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.838842Z"},"links":{"cited_paper":"/paper/2302.14816","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:4692cef19cc2b56e70b636649c69a8212324d41da6f68764cc343850bc79d65c","observation_id":"8dee4387-6d9d-43ae-b03c-bc87f325f838","resolution":{"observed_at":"2026-08-12T10:31:01.838842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.842806Z","title":"Structure- from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.842806Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:088b0037dc0d894e1df843b32902fb9e9972628dbef948a0425ec0f18abd9280","observation_id":"71f0d90f-0eee-4148-be45-cd37460a1245","resolution":{"observed_at":"2026-08-12T10:31:01.842806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.635182Z","title":"LAION-5B: An open large-scale dataset for train- ing next generation image-text models","venue":null,"work_id":"cd99d6db-70e5-4789-8982-d0c814a51c71","year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.846818Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:17f46e785848f19ed0689cf107dc97082f073538ddc65e44f0e337da8e3760d3","observation_id":"8d395caf-8812-4c3a-bae8-6b7db2335741","resolution":{"observed_at":"2026-08-12T10:31:02.639852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-12T23:51:23.176208Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-12T10:31:01.850501Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.850501Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:3b8e65f9583d73541814c67486d472bb3fcff0c064f1b64c72113ecdfef44778","observation_id":"3df7feef-382a-4e39-80d7-41a017370b5a","resolution":{"observed_at":"2026-08-12T10:31:01.850501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.855178Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.855178Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:afa98e1a086d7c7c0f755f2bae2b291fea0bd418d2be2ef1eb63515b33fd1090","observation_id":"c30ea8b9-020f-4cda-a46e-9ff8417922a1","resolution":{"observed_at":"2026-08-12T10:31:01.855178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08658","last_updated":"2023-05-03T21:50:14Z","snapshot_observed_at":"2026-08-13T13:42:03.711553Z","submitted_at":"2022-11-16T04:16:20Z","title":"Consistent Direct Time-of-Flight Video Depth Super-Resolution","version":2},"cited_work":{"arxiv_id":"2211.08658","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.08658","snapshot_observed_at":"2026-08-12T10:31:02.066996Z","title":"Consistent Direct Time-of-Flight Video Depth Super-Resolution","venue":"eess.IV","work_id":"10167513-6feb-443c-86c9-b6cb5d4419ed","year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.858949Z"},"links":{"cited_paper":"/paper/2211.08658","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:c2e0ed0e6feebab5c0fb8fed7b31699ae5d54149c5e344ec1884ffd1ae69f125","observation_id":"62dfb33b-894b-4d7d-959a-352469cf5a12","resolution":{"observed_at":"2026-08-12T10:31:02.073424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.616501Z","title":"Deepv2d: Video to depth with differentiable structure from motion","venue":null,"work_id":"4d024a27-73e2-4202-9313-70ce4c90857f","year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.863140Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:1b7e835ae401a6f81871f1af2fccc6002fdc3ab248a1031ecc79aa8ee5c10515","observation_id":"f6ebea8d-1e95-4ce6-bc31-eb07784e1f51","resolution":{"observed_at":"2026-08-12T10:31:02.620872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.603685Z","title":"TartanAir: A dataset to push the limits of visual SLAM","venue":null,"work_id":"745ceefd-52a4-4b8c-ab93-2195c20475c2","year":2020},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.866993Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d624f0aa510ff523c8ac601b2cbec2df1901a3df67d6e12114817c671ef5a4fc","observation_id":"0361a183-0daf-42c1-bce3-1b93728a0e41","resolution":{"observed_at":"2026-08-12T10:31:02.607933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.870791Z","title":"Less is more: Consistent video depth estimation with masked frames modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.870791Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:dd80fe7825c5751c0d2254834cd3822e95a561faee11037fc3efe73a91746102","observation_id":"4c62d0ce-8de2-4cb9-a30a-b8821dd201db","resolution":{"observed_at":"2026-08-12T10:31:01.870791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.584508Z","title":"Neural video depth stabilizer","venue":null,"work_id":"8d64290a-2482-4d29-a35b-c13cfa976476","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.874792Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:e0bdffe1d72c03aed5c6f079628a97ce1d645f25e4642af032e84aa46fe0e458","observation_id":"1d4eea3b-0414-4bdd-acd2-d3e4e11e8beb","resolution":{"observed_at":"2026-08-12T10:31:02.588590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.571041Z","title":"NVDS+: Towards efficient and versatile neu- ral stabilizer for video depth estimation","venue":null,"work_id":"cb7a15e7-0574-4797-96dd-093bfe3fdd45","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.878801Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:c02541cdd67655878fa2b08d88eef0a0644b6f9dbebe260cc4a2b0181df56a34","observation_id":"fc7e1971-26d4-4f21-809b-bf92c0b5a383","resolution":{"observed_at":"2026-08-12T10:31:02.576043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.882839Z","title":"Tune-A-Video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.882839Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:59f3aa63cc704153a42452a8e3e0a8e9666d7f2b4f372161a11853dda24240b1","observation_id":"adc8c878-75e9-47bb-afe0-7984c6043c7f","resolution":{"observed_at":"2026-08-12T10:31:01.882839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06090","last_updated":"2024-12-01T12:13:57Z","snapshot_observed_at":"2026-08-14T03:18:19.928426Z","submitted_at":"2024-03-10T04:23:24Z","title":"What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06090","snapshot_observed_at":"2026-08-12T10:31:01.887217Z","title":"Diffusion models trained with large data are transferable vi- sual models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.887217Z"},"links":{"cited_paper":"/paper/2403.06090","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:aaa0bc0d6bcc3f3baf370b7321b9888dc0d8c81213c36afa9f9f548aae1af549","observation_id":"914bfc38-a4fe-4180-baa8-6b680157748c","resolution":{"observed_at":"2026-08-12T10:31:01.887217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.550199Z","title":"GMFlow: Learning optical flow via global matching","venue":null,"work_id":"7796bcf3-e5a1-4f98-a7e9-6b35e626e2b7","year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.891212Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:93c2c1534c313c7ee9ec551cfe194362f65648705ceb44fe17e3bf1b661e0394","observation_id":"5edbce83-a6ab-40b9-b495-a17193892467","resolution":{"observed_at":"2026-08-12T10:31:02.554131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.538567Z","title":"Transformer-based attention networks for con- tinuous pixel-wise prediction","venue":null,"work_id":"7e7c57e9-7749-415a-9458-82f9f120aee1","year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.899685Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:683e118f38db09c827911cbf59c7e27ded9cc29614ef7ea4e8361c620227bb13","observation_id":"d82e66a5-ba70-49cf-8cc8-d1764c459633","resolution":{"observed_at":"2026-08-12T10:31:02.542700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-12T22:23:26.150274Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-08-12T10:31:01.903771Z","title":"Depth any video with scalable synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.903771Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:239acefa4c066ee073a561e94de55a6847a9bc48371966b3444b8ef091db2fc4","observation_id":"37055c38-c71b-49cb-a01b-db8052a962ff","resolution":{"observed_at":"2026-08-12T10:31:01.903771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.526600Z","title":"Depth Anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"8b787111-5621-4082-a8ad-965f62f9f1c8","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.908272Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:b0197270a6aaa89b1f81f341c731420186226189523ea26292e7d2890935502a","observation_id":"c001dabc-b9ce-4193-b837-2d24e45889a1","resolution":{"observed_at":"2026-08-12T10:31:02.531134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-12T10:31:01.912048Z","title":"Depth Any- thing V2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.912048Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:9b235bf1fc837338922b39464654507700f4e975ab88f65c876218475f837fa5","observation_id":"f656238b-e34b-4dd8-a0c3-67b7e9065a5e","resolution":{"observed_at":"2026-08-12T10:31:01.912048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.514729Z","title":"Rerender a video: Zero-shot text-guided video-to-video translation","venue":null,"work_id":"0893fa42-6561-4f93-ba89-04e6fc08c198","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.916309Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:75b3f18aa697119cf5df0edb72f068dd6db4e1daa8e36fb0790087e58f6bea81","observation_id":"4ada5868-a836-4b21-b93a-e6f1f4d06e91","resolution":{"observed_at":"2026-08-12T10:31:02.518859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.502558Z","title":"MVSNet: Depth inference for unstructured multi- view stereo","venue":null,"work_id":"22d16ae0-a4ab-4a8f-a6c3-2500e05cbbcb","year":2018},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.920169Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:d88a746d286fe5375d9383a508e4edba279177d14c6f0780631ea49d9ea0c638","observation_id":"df9d140d-52f4-4c24-b285-c596c080867f","resolution":{"observed_at":"2026-08-12T10:31:02.506753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.490734Z","title":"MAMo: Leveraging memory and attention for monocular video depth estimation","venue":null,"work_id":"9cfbc5eb-f786-468c-b4a9-b68b5dbe4014","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.924254Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:299422c9896634ffddfd3580eb06821a56c1fd492ee7a1e5fa264fd00c083643","observation_id":"b92f36a0-5e7d-4bb1-add5-4d1ba24db125","resolution":{"observed_at":"2026-08-12T10:31:02.494777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.478473Z","title":"FutureDepth: Learning to predict the future improves video depth estimation","venue":null,"work_id":"839e9e14-3d22-4c23-97b1-dac30370c4cf","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.928282Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:aab85422b5c25a91cda7d85158a0e219e51e6cfe86d5473a59fec28c8f70134f","observation_id":"6516fa3c-291d-4ed3-9cf8-3eaa0994df44","resolution":{"observed_at":"2026-08-12T10:31:02.482662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.00569","last_updated":"2020-03-28T08:26:57Z","snapshot_observed_at":"2026-08-13T19:53:50.235274Z","submitted_at":"2020-02-03T05:38:33Z","title":"DiverseDepth: Affine-invariant Depth Prediction Using Diverse Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.00569","snapshot_observed_at":"2026-08-12T10:31:01.932136Z","title":"Di- verseDepth: Affine-invariant depth prediction using diverse data","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.932136Z"},"links":{"cited_paper":"/paper/2002.00569","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:9d9e510c9605b7f6b1fed94b48e3713f99eb30c62651a9b40ac234b3029ffd8f","observation_id":"e33824b0-77e0-4717-83bc-21c33eb92127","resolution":{"observed_at":"2026-08-12T10:31:01.932136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.465978Z","title":"Met- ric3D: Towards zero-shot metric 3d prediction from a single image","venue":null,"work_id":"bbd894fa-543f-4c71-9fe7-f30ed54a3492","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.936092Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:f3c8bb1ccdd6dc107b8227a37291dbc7e873f71d3d16d7771e4a167426715be1","observation_id":"6b45c223-9bff-4909-b076-6bbe2b5d3fa6","resolution":{"observed_at":"2026-08-12T10:31:02.470501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.452428Z","title":"NeWCRFs: Neural window fully-connected CRFs for monocular depth estimation","venue":null,"work_id":"dcf9707c-8bbb-448a-9195-b89ff407065d","year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.939684Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:20a458a9c853305b46a5d1fd35ff90fd216d38849805b5ea7231f6b755d33e2a","observation_id":"5ad4e55d-affb-4aaf-b72d-91abd1cd4616","resolution":{"observed_at":"2026-08-12T10:31:02.456618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.440466Z","title":"Exploiting temporal consistency for real-time video depth estimation","venue":null,"work_id":"993816e6-c34c-497a-b7ef-b9420dd208de","year":2019},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.943636Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:8be24e126c3830a943c7db5df8c5e6c47e562d1e6b58d97cd23d9881eb6015de","observation_id":"00272e04-f534-4c59-9f72-b0c00e4637d0","resolution":{"observed_at":"2026-08-12T10:31:02.444924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.426551Z","title":"BetterDepth: Plug-and-play dif- fusion refiner for zero-shot monocular depth estimation","venue":null,"work_id":"9bd76c7f-cde9-4423-96a1-09bef96bba6b","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.947360Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:10a623cb4235f78640cd984b1bbeed388faebf67b3c9caf019f2eedd7016e866","observation_id":"f309b9ae-c06f-4312-9e26-58c0eb195f34","resolution":{"observed_at":"2026-08-12T10:31:02.431214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.413334Z","title":"Consistent depth of moving objects in video","venue":null,"work_id":"f1586f6e-cd01-42c8-9a06-165eb736fb5d","year":2021},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.951224Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:961e27687b5ab8f19bff911a036bfde17110f8698bedb439a9020ec350ee7fb5","observation_id":"080af1e0-f9bf-4313-ae56-78081d158b03","resolution":{"observed_at":"2026-08-12T10:31:02.417580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.400007Z","title":"Towards consistent video edit- ing with text-to-image diffusion models","venue":null,"work_id":"b5c1a17f-44e5-403d-b735-0c69f856fefd","year":2024},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.955157Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:ec93aedd35a72147f5e77f9fb53ba92ef91fb70a51d57e4c915ce01bd60ce9a6","observation_id":"8fdf208e-210a-45c0-8063-9465219d8c2a","resolution":{"observed_at":"2026-08-12T10:31:02.404731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02153","last_updated":"2023-03-03T18:59:47Z","snapshot_observed_at":"2026-08-13T12:32:28.384053Z","submitted_at":"2023-03-03T18:59:47Z","title":"Unleashing Text-to-Image Diffusion Models for Visual Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02153","snapshot_observed_at":"2026-08-12T10:31:01.959283Z","title":"Unleashing text-to-image diffusion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.959283Z"},"links":{"cited_paper":"/paper/2303.02153","citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:93941430987b4bb76ed6c84f2e4be584ce6ac1dc6ddfce1094d5e4b6adc03049","observation_id":"0a3e5fbf-5e3d-485e-92b1-4bd17bd1b5d4","resolution":{"observed_at":"2026-08-12T10:31:01.959283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:01.963767Z","title":"Discrete cosine transform network for guided depth map super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.963767Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:582a9866d72118d7718eb8102448ca6a54fa5b23c67eaf163e4527c8afa072c1","observation_id":"3833efa8-c59a-4798-9eae-ba395ee413d5","resolution":{"observed_at":"2026-08-12T10:31:01.963767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.376823Z","title":"DDFM: Denoising diffusion model for multi-modality image fusion","venue":null,"work_id":"46936c83-0f42-4cb5-90ce-f78e78deb797","year":2023},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.967642Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:25f26ad9bdf63fb88c7cf142e424e512503df48d7a314bfb97d445051610bd0d","observation_id":"7796da87-de8d-4487-ad04-8d4727b1f475","resolution":{"observed_at":"2026-08-12T10:31:02.381613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.363443Z","title":"PointOdyssey: A large-scale synthetic dataset for long-term point tracking","venue":null,"work_id":"41b47218-4206-43de-91d3-b4d3e82fef54","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.971313Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:605c69ef7eb770046fe6ad39304ecb76ea3fcae3d75e44e1ae93cef10d1328d6","observation_id":"60fe359e-4536-48dc-827b-f9cb8b9ff1d3","resolution":{"observed_at":"2026-08-12T10:31:02.368286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:31:02.351008Z","title":"num-frames","venue":null,"work_id":"3727f731-7ed9-4b89-b9d2-eb9605411be6","year":null},"citing_paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T10:31:01.975283Z"},"links":{"citing_paper":"/paper/2411.19189"},"observation_digest":"sha256:5d7ab7f2eadee11f961ea9a1cdb8ebad7e08c60eed40490421bf6fa6ceeec46a","observation_id":"5d474f9b-87f7-44cf-bfc7-7ffb4ba00e1e","resolution":{"observed_at":"2026-08-12T10:31:02.355165Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19189","last_updated":"2025-03-17T12:43:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:43:00.612672Z","submitted_at":"2024-11-28T14:50:14Z","title":"Video Depth without Video Models"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":45},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 1 inbound Pith citation observation for arXiv:2411.19189."}