{"as_of":"2026-08-13T00:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3fa708488369c3b54178118be890ab01e9744f29f40fb0bb867449617cd6e8d5","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T12:26:49.610580Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:56:18.867382Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17249","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-03T20:31:54.523048Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2411.17249","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:f2960cc0b915a2217ddab53fd645bff7d127b14734b6fb24c41a51c4f50717c5","observation_id":"c46a1f6e-6f13-4b8f-9a6c-98450bc7130f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17249/citation-record","integrity":"/paper/2411.17249/integrity","json":"/paper/2411.17249/citation-record.json","paper":"/paper/2411.17249"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.606422Z","title":"Stable diffusion version 2","venue":null,"work_id":"9c0e0a4d-6a6c-4ba5-919d-6a9a2117fe8d","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.326039Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:a718efb705b6c0b23bb169ac41c4876eea5c2410a6a8cb23f7c1ea20fcb6b58e","observation_id":"187910a2-3575-461a-9c28-bc9b1ac1baef","resolution":{"observed_at":"2026-08-12T12:26:50.611236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.590491Z","title":"Rethinking induc- tive biases for surface normal estimation","venue":null,"work_id":"e7e55ae3-a82a-403e-9cdf-620754518080","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.331132Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:e414adebf8cff2ff09ca5737e19ca3856df8d479d4fd6bd357c9038e717079f8","observation_id":"59d925b9-d6a3-43cc-b7ef-504d0728e725","resolution":{"observed_at":"2026-08-12T12:26:50.595455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.335953Z","title":"Es- timating and exploiting the aleatoric uncertainty in surface normal estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.335953Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4e4070fb7cc1b4fd2384b2d918f32ef347a5e5320776bf8a5337a86694587439","observation_id":"e4575005-7e21-49cc-9ca6-4366e1e6a895","resolution":{"observed_at":"2026-08-12T12:26:49.335953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.565260Z","title":"Marr revisited: 2d-3d alignment via surface normal prediction","venue":null,"work_id":"2e10ce82-cbb1-4927-9946-31249e6b13df","year":2016},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.340963Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2c1afe105a6bd2f163f67d463aa999cf8d8f9cc779529ee0afc85e0c88aae916","observation_id":"262d1cd3-b732-4e78-8a39-4f313c02ed5d","resolution":{"observed_at":"2026-08-12T12:26:50.570136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T12:26:49.345431Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.345431Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:beee49919f2f4f08808ca336651e03003a84b4a064d10844b75749318d6218d7","observation_id":"2518f65c-8653-4fde-acf1-c5c1fb3e8f37","resolution":{"observed_at":"2026-08-12T12:26:49.345431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.350473Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.350473Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2ae963f5f1b54090544e34103590ca633208ade703f73325387bd9eed2437808","observation_id":"7e247130-d8f9-43b0-9ce8-11808caffa17","resolution":{"observed_at":"2026-08-12T12:26:49.350473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.354841Z","title":"A naturalistic open source movie for opti- cal flow evaluation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.354841Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:aeb529b189ebb8d45148e608d888f2fb922dbf2f7a6759a8359416cc0f71636f","observation_id":"65ececb4-b366-4fa1-bc0b-fbd7eea0694e","resolution":{"observed_at":"2026-08-12T12:26:49.354841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.359265Z","title":"A computational approach to edge detection","venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.359265Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:97b33ad1f86a98d5718fef15f5e06db13b5063b1c3c0fd978ea64ebb8f3ccb31","observation_id":"245df49e-2c83-4604-98f2-8341d16205c1","resolution":{"observed_at":"2026-08-12T12:26:49.359265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.520093Z","title":"Learning structure affinity for video depth estima- tion","venue":null,"work_id":"41a2e495-191c-4f15-94e0-68fda925d940","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.364198Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:77e996c8e00d1e44f25a42abdf8bd6ab8d0ffbcb49dea12f70cf420e03801132","observation_id":"d2c3d993-fed7-4cfe-a952-3673610f9586","resolution":{"observed_at":"2026-08-12T12:26:50.525276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.494957Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion,","venue":null,"work_id":"6efd5b4e-99e4-47b8-bda9-b9a58b7488c3","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.373053Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:b91575f20c052e1ac7f3931d9e7459df2804c3811f9f8167d1aee010b1c4ff1a","observation_id":"56c2cd09-9da3-4dc2-b004-a6773999b77c","resolution":{"observed_at":"2026-08-12T12:26:50.499768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.378047Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.378047Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:638e939948fd305c1049e3fba09fd7e5d1ce9278170ddf193ba81f491abf4290","observation_id":"01b72b87-6db6-4e18-b6fc-9db078e79c6c","resolution":{"observed_at":"2026-08-12T12:26:49.378047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.469948Z","title":"Surface normal estimation of tilted images via spatial rectifier","venue":null,"work_id":"71b0e25a-bb9f-404e-befc-99961df9f7a6","year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.382110Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4119578a5642556eaf33e4dbbd950aafb0994f06c475ddd0da657910bd8b86f2","observation_id":"97050a54-893b-4653-b268-dfea066a0245","resolution":{"observed_at":"2026-08-12T12:26:50.474955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.386304Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.386304Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2f693c15f9b52c2e897d6cf94874bcd0fc54248f7e088cfb94ea5a8ffbd4e14f","observation_id":"658f4f7f-8352-4d5b-8e2e-38a96f3f628e","resolution":{"observed_at":"2026-08-12T12:26:49.386304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.390520Z","title":"Omnidata: A scalable pipeline for making multi- task mid-level vision datasets from 3d scans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.390520Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:c14faf85a5b3cebcc3fbf8deff623668f7486a0c36c4ad976d90d3dbc5e185cb","observation_id":"f2f4f897-f0be-4af4-9219-7787f9111105","resolution":{"observed_at":"2026-08-12T12:26:49.390520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.394856Z","title":"Predicting depth, surface nor- mals and semantic labels with a common multi-scale con- volutional architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.394856Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4837c3cd0dfd5919c8c18990ad1eed69d0948889f16b9c2692d13ceb90c48658","observation_id":"6ec9e73d-34da-4b78-aaa4-2128f5f59dc9","resolution":{"observed_at":"2026-08-12T12:26:49.394856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.399804Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.399804Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:55a680ed2285ca0c056007cec7a0ae38a8cd26d453bb44e90b367d379880b33b","observation_id":"2c9d8aa0-67eb-462d-8b0e-dd08457fff4e","resolution":{"observed_at":"2026-08-12T12:26:49.399804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.414322Z","title":"Unfolding an indoor origami world","venue":null,"work_id":"666b0587-f163-410e-a934-31c6ba5d5335","year":2014},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.404192Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2ef4940b4e652b6bb25afebc93fca26802d673899f123c292032e197d55ab0f5","observation_id":"032f69e2-a540-41a1-8fa4-26a649dd0315","resolution":{"observed_at":"2026-08-12T12:26:50.419189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.408572Z","title":"Deep ordinal regression net- work for monocular depth estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.408572Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:7efa68071281a269a64aa67f46158aebfe2759f83ec9cbff520b79db8e820dd5","observation_id":"82fae043-fe50-4ef7-99ee-7871cdf01673","resolution":{"observed_at":"2026-08-12T12:26:49.408572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.389554Z","title":"Geowiz- ard: Unleashing the diffusion priors for 3d geometry esti- mation from a single image","venue":null,"work_id":"ae95efc1-677b-4c81-a938-4e290fec47ea","year":2025},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.413308Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:6da5204c86bc25962a7e0f4365407a656195ee349dffe39b6bc5f3fb0b54f77f","observation_id":"2ae88873-2835-4af3-abb9-d76d0f0c1ef9","resolution":{"observed_at":"2026-08-12T12:26:50.394471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.417483Z","title":"Fine-tuning image-conditional diffusion models is easier than you think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.417483Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:e1110f94518532a732f25ef768eadb33663160464955eb6af577546bf95652b5","observation_id":"10fd91f8-9759-4813-ada6-a8b09b7ad15b","resolution":{"observed_at":"2026-08-12T12:26:49.417483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.421736Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.421736Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:cf78cac7bdfb34a53aa6433b596887ac92b022ce7a3998c15e4ab7d40457c7b3","observation_id":"1abc2e7b-9865-47f3-b0df-773249ae66a6","resolution":{"observed_at":"2026-08-12T12:26:49.421736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.425894Z","title":"Unsupervised monocular depth estimation with left- right consistency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.425894Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:3d2ea18712716b9511dcd1f699b0b02c0d931e771e84002022ea8ea7f45bfa3a","observation_id":"f616ba72-e35a-4819-8b28-52d37ebe15e0","resolution":{"observed_at":"2026-08-12T12:26:49.425894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.355479Z","title":"Sparsectrl: Adding sparse controls to text-to-video diffusion models","venue":null,"work_id":"c2deb632-e794-42fd-8b01-12d5441da529","year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.430555Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:bddfb26b813c2a24a305846b1ff58af8dfd5d401b196237c8bf12a92e2afeab6","observation_id":"e8dbd863-3354-471b-b356-c0b7b7935331","resolution":{"observed_at":"2026-08-12T12:26:50.360134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-12T12:26:49.434878Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.434878Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:792a94a26c2b5badff3f24d42b2602bc9c1e65a24f35544e225b7fbfa8f13244","observation_id":"975036b5-c9bd-48f2-964e-05b94accd2ff","resolution":{"observed_at":"2026-08-12T12:26:49.434878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.439392Z","title":"Cameractrl: Enabling camera control for text-to-video generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.439392Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:40f32be9bb512f7e6af3d84c75a97b0b744078293ed9ea95bbbb56d0fa98d77e","observation_id":"9ac0534f-b42b-44f2-aa42-633ffb811955","resolution":{"observed_at":"2026-08-12T12:26:49.439392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18124","last_updated":"2025-01-18T20:14:54Z","snapshot_observed_at":"2026-08-12T22:36:38.511678Z","submitted_at":"2024-09-26T17:58:55Z","title":"Lotus: Diffusion-based Visual Foundation Model for High-quality Dense Prediction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18124","snapshot_observed_at":"2026-08-12T12:26:49.443740Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.443740Z"},"links":{"cited_paper":"/paper/2409.18124","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:8c81c3291ac3a5190d36ebaf2fffb7ac3bfae53645a37ea96e9ce6443c9a1ee3","observation_id":"9b02d17b-0e95-4da9-aa2b-5900149ae4f9","resolution":{"observed_at":"2026-08-12T12:26:49.443740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.330527Z","title":"Au- tomatic photo pop-up","venue":null,"work_id":"88b58f46-c504-4c3c-9807-6a7f77b07f01","year":2005},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.448544Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:267e6aaa88aaee22191f9aca4df58af265b108138ff0d2748d0caa598c8804a4","observation_id":"7ac5a2f9-31bf-4f7f-91c8-ba9acc66daf9","resolution":{"observed_at":"2026-08-12T12:26:50.335238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.315773Z","title":"Recov- ering surface layout from an image","venue":null,"work_id":"d4c7f131-246c-4815-b374-e11b594fb74c","year":2007},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.453035Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:c872fff382836ab880c78ed4d85ddb481ba6c6d90d4c32d6fd4a9812d511c2cf","observation_id":"cf3d1765-4faa-4c7b-8986-b284eb72a750","resolution":{"observed_at":"2026-08-12T12:26:50.320375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.457920Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.457920Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:f103defae49553cee7bcc269740c8cc0fa4723eabd36419059850b681a99ecde","observation_id":"1df4caab-b875-4548-954e-4105eb5519bc","resolution":{"observed_at":"2026-08-12T12:26:49.457920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-12T22:52:07.327467Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-08-12T12:26:49.462374Z","title":"Depthcrafter: Generating consistent long depth sequences for open-world videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.462374Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:84185d6ad42a8041c6ba806aeb0aee24ec622e2987498bf8028c0b1ff50dfecc","observation_id":"40020932-d4fa-4969-82a0-695cf3e8a991","resolution":{"observed_at":"2026-08-12T12:26:49.462374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.290022Z","title":"3d common corruptions and data augmentation","venue":null,"work_id":"dc599bcb-2b53-4419-98e1-0b55b585ddab","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.467369Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:986e1056d136455f2c3d697c53be1673cedde92d1b233a574986100f815e0bc0","observation_id":"2568f948-f0d4-4a91-adc3-4ff448e40c6d","resolution":{"observed_at":"2026-08-12T12:26:50.294598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.274014Z","title":"Repurpos- ing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"42986922-a9a3-4589-aab5-36fc1fa8f577","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.472397Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:ebf222e2f219c3b713da21f5b6144730dfa8b0e7aa503c82621ff1486b090a51","observation_id":"555eb39d-6469-49f0-9625-4f2497ded9d8","resolution":{"observed_at":"2026-08-12T12:26:50.279786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.258837Z","title":"Wetzstein","venue":null,"work_id":"e62003a1-476c-46cc-8122-5071b3b267ab","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.476689Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:fb6df834d807c8fb7fff362912492bebe5a8f0e88e28c8aa9ce620107f7a0c06","observation_id":"a67698da-6d59-4469-b48f-c56f66fa77f2","resolution":{"observed_at":"2026-08-12T12:26:50.263587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.244307Z","title":"Sift flow: Dense correspondence across different scenes","venue":null,"work_id":"34f6f351-7913-4f5d-acd3-774fdeb3a441","year":2008},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.480809Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:41faeacdc895b1f2fc4db733ed568d8f807236a849a1c47cebdda66fa0def1f9","observation_id":"787e8a8c-88ec-48e2-85cc-c6f8f7caf426","resolution":{"observed_at":"2026-08-12T12:26:50.248950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.229213Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":"33f2f245-5bf8-4aae-80ea-7acc520eb74e","year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.485369Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:4d4aad727ef0fe43b9c2698cf6764c74801b571b3e81ee543e30661a6a1dcaa5","observation_id":"f251f2a2-e6d2-4adc-9891-fab44589eaad","resolution":{"observed_at":"2026-08-12T12:26:50.234128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.489604Z","title":"Refusion: 3d reconstruction in dynamic environments for rgb-d cameras exploiting resid- uals","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.489604Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:738e67d39cfba7d129a92e0c4849f0d8cb539ec1e48b9e8a2f999c0fbabee68a","observation_id":"88326bde-0c7e-4fe4-86e7-a20d4c0c19fd","resolution":{"observed_at":"2026-08-12T12:26:49.489604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.202902Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"01a9d6f5-b7dc-4f29-b0cc-d91e659649eb","year":2017},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.493902Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:9ecd912bc831467e3948643c324253bd1ffd87908b1f26790bc862be4d3d2995","observation_id":"a2df41bb-4bb0-4aa4-94fe-464ef2fc8c1d","resolution":{"observed_at":"2026-08-12T12:26:50.208525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.187135Z","title":"State of the art on diffusion models for visual computing","venue":null,"work_id":"3bb622d6-18ac-4afa-a945-de4d0d4a7152","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.498450Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:d7292f2525ec6096a6f517b3be1c167d10f16833b515403ad4a4f114f6c68347","observation_id":"dc4db023-3044-4f21-98b7-1917724f6012","resolution":{"observed_at":"2026-08-12T12:26:50.192683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T12:26:49.502751Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.502751Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:0f2e4988ac92e946f46fc256236df1e9deeb61e3f6d1adab55d83b07d7efcc62","observation_id":"41b6bb34-8ea3-4e49-aadf-4b030892ad42","resolution":{"observed_at":"2026-08-12T12:26:49.502751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.508084Z","title":"Geonet: Geometric neural network for joint depth and surface normal estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.508084Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:bee141b4512bbe5f09552f96c815986319fd9c5c3a125b2d2e65a362201b46df","observation_id":"e9c72c4b-9ab3-4974-a4db-0507721a899a","resolution":{"observed_at":"2026-08-12T12:26:49.508084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.512476Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.512476Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:5e83be12eab2bbdf9876fba69646b826e2e684188989abddba3d99f3bc9a4b8d","observation_id":"a4a05eea-5326-40b2-871a-9ad9aa4a2b96","resolution":{"observed_at":"2026-08-12T12:26:49.512476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.516819Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.516819Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:275a727b2cb4259c1c07349a6094fad193656f6d7f604c42a5c7e3dda624cf91","observation_id":"cc6973c1-3e45-4488-8bf9-8313d8c3d00e","resolution":{"observed_at":"2026-08-12T12:26:49.516819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.521458Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.521458Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:1146406218dfa0d1494b5cc3f9452b44e2c833db2c70fe7f0ff4f1106b5f48f0","observation_id":"1a86e612-d6b3-4773-82be-6f67fc50394b","resolution":{"observed_at":"2026-08-12T12:26:49.521458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.525708Z","title":"Make3d: Learning 3d scene structure from a single still image","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.525708Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:c2f6903334a0e5839c13b5927a52d9b420fba604403a106e02bbe2d79ad5c0bf","observation_id":"447cf863-7a9f-4cf0-8274-1461c587a32e","resolution":{"observed_at":"2026-08-12T12:26:49.525708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01493","last_updated":"2025-06-07T07:24:16Z","snapshot_observed_at":"2026-08-12T23:51:23.176208Z","submitted_at":"2024-06-03T16:20:24Z","title":"Learning Temporally Consistent Video Depth from Video Diffusion Priors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01493","snapshot_observed_at":"2026-08-12T12:26:49.531022Z","title":"Learning tem- porally consistent video depth from video diffusion priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.531022Z"},"links":{"cited_paper":"/paper/2406.01493","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:91ac5f8d62db76326e97913810b1fafd0a23412e18f7619c54977185472f279f","observation_id":"55069968-05a1-4281-9857-e5a3511f756e","resolution":{"observed_at":"2026-08-12T12:26:49.531022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.535752Z","title":"Human4dit: 360-degree human video gen- eration with 4d diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.535752Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:51cf1276159012be857c1119b4113b737717de143d5e1f0c7af1684c72cb21c5","observation_id":"20332be9-bc3b-422c-8fc7-30c45a9ad1cb","resolution":{"observed_at":"2026-08-12T12:26:49.535752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-12T12:26:49.540029Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.540029Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:8b576513a6c0a5db3951db577b64a95c98022982ba8f1ef0d9ddec02bc4b48ae","observation_id":"a0b2460d-c2dd-4561-868d-92c11a7716e5","resolution":{"observed_at":"2026-08-12T12:26:49.540029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T12:26:49.544620Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.544620Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:42c41fb0128b59c21f56d486f727290a973136ef36a4588093ac71c9f671a686","observation_id":"0a6d8dc2-3177-467d-bc8f-d2e7e7f35f97","resolution":{"observed_at":"2026-08-12T12:26:49.544620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.549250Z","title":"Diffusers: State-of-the-art diffu- sion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.549250Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:2c6e3c0d93b0138d06dd66bfbeecbe0c5450a05a47655a7a1e898356b7af97e7","observation_id":"c8729ca6-1a4e-4c09-95f8-6d771d0c42de","resolution":{"observed_at":"2026-08-12T12:26:49.549250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.100089Z","title":"Vplnet: Deep single view normal estimation with vanishing points and lines","venue":null,"work_id":"39375c27-685a-4576-9e41-e91504c8a9c6","year":2020},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.553546Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:f27a11d1f9405e3666119887c1edbfde29f052fa295c0c760a8e792e14b80f72","observation_id":"10f8e96c-0a6e-4de1-bf79-f984be9415ae","resolution":{"observed_at":"2026-08-12T12:26:50.105611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.085128Z","title":"De- signing deep networks for surface normal estimation","venue":null,"work_id":"34c110ad-f61c-4b73-9c36-cdcbdc781aae","year":2015},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.558243Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:16dad165e5241d66597e01e9f59edd0dfb17a32d490eddabf7fa5aca064563e8","observation_id":"11754409-b13d-45f4-9751-d988e5fbbe34","resolution":{"observed_at":"2026-08-12T12:26:50.089789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.069155Z","title":"Less is more: Consistent video depth estimation with masked frames modeling","venue":null,"work_id":"7b618c5f-8138-4195-b888-84d81c2065de","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.562494Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:ec964d7cd65003c0cd74815be76789d660af2c62f852b11623d5cc0bc1986ee6","observation_id":"b2cbdd1c-6395-4ba8-a6b6-f9f690b4a448","resolution":{"observed_at":"2026-08-12T12:26:50.074061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.566738Z","title":"Neural video depth stabilizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.566738Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:584e40c42718ebd323c0aacab5e2b35b51f1c279301155d9b30cbfec23588867","observation_id":"a85f3e65-fcab-43ec-bdca-3f32631c5da8","resolution":{"observed_at":"2026-08-12T12:26:49.566738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02509","last_updated":"2024-06-04T17:27:19Z","snapshot_observed_at":"2026-08-04T13:02:12.217544Z","submitted_at":"2024-06-04T17:27:19Z","title":"CamCo: Camera-Controllable 3D-Consistent Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02509","snapshot_observed_at":"2026-08-12T12:26:49.571053Z","title":"Camco: Camera- controllable 3d-consistent image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.571053Z"},"links":{"cited_paper":"/paper/2406.02509","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:eece5f4629743ad84e947235b250681720848af38ce44bcb259660774c026c54","observation_id":"b0acf96b-5ada-4329-8bae-d08283b2dda1","resolution":{"observed_at":"2026-08-12T12:26:49.571053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.044380Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"483caf5b-9683-4d05-801a-4de8f12be35c","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.575647Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:f482c13bab90c58d7f994ad5de790d086b9f9563b2fd8ed9622d76ed702e0f1d","observation_id":"d05fd471-d3b3-4e86-bdd8-70c6a9869666","resolution":{"observed_at":"2026-08-12T12:26:50.049053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-12T12:26:49.579883Z","title":"Depth any- thing v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.579883Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:6dc021af58e7e99e801fcf18a1723e555219bbc8c7a41d72837203441b56648b","observation_id":"117cd4ed-22cd-4fbd-b815-4464841292b2","resolution":{"observed_at":"2026-08-12T12:26:49.579883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.029357Z","title":"En- forcing geometric constraints of virtual normal for depth pre- diction","venue":null,"work_id":"f2cc5373-347a-4a91-a69f-e899b0406d27","year":2019},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.584342Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:1b9ceb1477ce09ecd3bee6af3b258af7b6c76eebf793a56dc22d6e282e190c56","observation_id":"8a1668ba-09a1-4b4b-8c4b-55c34ccf21cb","resolution":{"observed_at":"2026-08-12T12:26:50.034622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:50.013675Z","title":"Rgb ↔x: Image decomposition and synthesis using material-and lighting-aware diffusion models","venue":null,"work_id":"43d60e76-acf5-4560-9711-98c07899985d","year":2024},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.588513Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:dbefd2fed4d57d3bb563093e62b0ec1607de20e51b7f4e41762634e11ae3b3c8","observation_id":"d5764505-c86a-48da-9dd9-939a82876222","resolution":{"observed_at":"2026-08-12T12:26:50.018555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.997159Z","title":"Hierarchical normalization for robust monocular depth estimation","venue":null,"work_id":"c6ecacb9-1159-4f9c-b1c5-5b7c38868dcb","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.593053Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:3d331b9d96dbc49d95e7c76ee1f1514ea867bdd084e7ff16fa011b2d2a15f8e7","observation_id":"2acbd3f7-9950-4622-82d2-f444f9d6f573","resolution":{"observed_at":"2026-08-12T12:26:50.002051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.981350Z","title":"Arf: Artistic radiance fields","venue":null,"work_id":"7c3fb86d-f72f-49b3-becc-832a5d69ee16","year":2022},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.597204Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:728b8f481337998ae40ab5d524948fee63d40d202950ab0dd391de4f82bb706c","observation_id":"0c1eebdc-368c-4d59-b42d-321006368869","resolution":{"observed_at":"2026-08-12T12:26:49.986336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.966060Z","title":null,"venue":null,"work_id":"cfc14b48-a406-4c18-a935-61259226b01b","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.601496Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:965a1dd8ae1c9fdde0232a3656c814efa38cdd77b9ce915c1f29d7c790399283","observation_id":"2a277178-70c8-4b7b-9787-2d804b36647f","resolution":{"observed_at":"2026-08-12T12:26:49.970703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.949919Z","title":"We utilize the official implementations of Depth Anything V2 [56] and Marigold-E2E-FT [20], adapting temporal blocks from the UnetMotion architecture in the Diffusers [49] library","venue":null,"work_id":"3e16de3c-8c18-402b-9dd1-e8043d6891e6","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.605761Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:546ee2cf338b600e985648b2accfe74eca45e9d21c1bcc0fb4166835a15a37ed","observation_id":"1d80dda8-fece-4ef0-aa11-14c1ef3d8e8e","resolution":{"observed_at":"2026-08-12T12:26:49.955597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.932911Z","title":null,"venue":null,"work_id":"0089130a-ef71-4d2c-b2c9-5604c6912853","year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.610580Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:69ba889b7b2b17b139424ce6287bb4607fa7e1bd9397eb2f83c06267014b3afd","observation_id":"3c3225c1-1da2-49aa-916e-77646c08e3d5","resolution":{"observed_at":"2026-08-12T12:26:49.938514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T12:26:49.368602Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T12:26:49.368602Z"},"links":{"citing_paper":"/paper/2411.17249"},"observation_digest":"sha256:21ed5383fb7d2912e37f7a6ab2cf5188c8caac266b1e79eaece9f782388e2b2f","observation_id":"55c7ddf7-4846-4016-ab8f-eb0e4350a923","resolution":{"observed_at":"2026-08-12T12:26:49.368602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 1 inbound Pith citation observation for arXiv:2411.17249."}