{"as_of":"2026-08-18T10:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aebda1fcbb28b025a0ad438ed4e56df18f982fa92ae65bb2a5718840c9f80188","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:49:17.868077Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:13:38.707597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T19:13:40.995213Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"cited_work":{"arxiv_id":"2412.16155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16155","snapshot_observed_at":"2026-08-15T19:13:40.995213Z","title":"Can Generative Video Models Help Pose Estimation?","venue":"cs.CV","work_id":"1231c1d0-9a12-4d56-931b-8d6da8759b27","year":2024},"citing_paper":{"arxiv_id":"2506.17220","last_updated":"2025-06-23T02:14:32Z","snapshot_observed_at":"2026-08-18T02:34:50.550906Z","submitted_at":"2025-06-20T17:59:55Z","title":"Emergent Temporal Correspondences from Video Diffusion Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:13:38.707597Z"},"links":{"cited_paper":"/paper/2412.16155","citing_paper":"/paper/2506.17220"},"observation_digest":"sha256:fdd5efc593319c4adca6f60a79b932505c642965f718095c4994250c08b43dd4","observation_id":"335da015-e5d6-4308-bdd9-aaed01a63ee9","resolution":{"observed_at":"2026-08-15T19:13:41.000631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16155/citation-record","integrity":"/paper/2412.16155/integrity","json":"/paper/2412.16155/citation-record.json","paper":"/paper/2412.16155"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T10:49:17.455905Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.455905Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:3c29df41886de76a22281cd64e2aa0162e7e1e5ce2836fa400f43a5a55505a06","observation_id":"15073bd2-ebec-49fa-96cc-1dc675cd3e19","resolution":{"observed_at":"2026-08-11T10:49:17.455905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:19.243764Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"74e4f1dd-ff0c-498f-a3c4-f5ade4016b7f","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.463000Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:d183eac39b7b4a9459c42c40ffcbdb03fff71bf92bd717abdf3060547fa72e4a","observation_id":"2b6703c0-3549-458f-9344-e202fd177d44","resolution":{"observed_at":"2026-08-11T10:49:19.259037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-16T14:25:07.068786Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-11T10:49:17.467825Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.467825Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:03f40f866375821ef6c73f543656c29492154d7a3dfcccc3ac5ae753131f0b63","observation_id":"3dfae3fd-ace5-4f69-aaf5-cc1c5a7be6a8","resolution":{"observed_at":"2026-08-11T10:49:17.467825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.476836Z","title":"Surf: Speeded up robust features","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.476836Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:62ea432c04414452b7dd6d91e7bc99f45af70f5954b391bfd73d62c0c1f23adb","observation_id":"70d139bb-d929-468c-bf1a-5365ef4971ea","resolution":{"observed_at":"2026-08-11T10:49:17.476836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07096","last_updated":"2025-02-25T18:09:30Z","snapshot_observed_at":"2026-08-16T13:01:07.227514Z","submitted_at":"2024-11-11T16:18:28Z","title":"Extreme Rotation Estimation in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07096","snapshot_observed_at":"2026-08-11T10:49:17.486340Z","title":"Extreme rotation estimation in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.486340Z"},"links":{"cited_paper":"/paper/2411.07096","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:fa5bb2909147df3c4b0726f96d27a4ae5f639d92eb754c4b91adfada20076eb1","observation_id":"b398ad21-08ba-418b-9701-9f693493a2ef","resolution":{"observed_at":"2026-08-11T10:49:17.486340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.497324Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.497324Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:69f62cb97dfcf79fc35ae63ced1b9f37dd10ee830d4c31d2c1b27bf9b0e39741","observation_id":"56902389-eab0-4b9c-9021-a68a3111a7a9","resolution":{"observed_at":"2026-08-11T10:49:17.497324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.506493Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.506493Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:40ca44d8959b83117b62452a75fb5dc6e22c422be8a924f642b554bc8abe9d7c","observation_id":"57fd75e7-05e2-4ce8-a32f-1ec7ce6f458a","resolution":{"observed_at":"2026-08-11T10:49:17.506493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.515931Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.515931Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:1eb2c01fa265e7d5f7b2828ce06ea4462b52483db3f41f783f7be6216654bd59","observation_id":"b05ed16e-14a3-4b98-9652-7305f80bc244","resolution":{"observed_at":"2026-08-11T10:49:17.515931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:19.150440Z","title":"Extreme rotation estimation using dense cor- relation volumes","venue":null,"work_id":"d15c238d-7fc5-439f-9c9c-3e0c9a0d65c0","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.522614Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:eb442128a23fec58d7466804a03e64704481b508cf00d031cc40cfecaa0393f6","observation_id":"52acb472-2b02-4c22-9167-89fa37aad742","resolution":{"observed_at":"2026-08-11T10:49:19.155785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:19.129960Z","title":"Wide- baseline relative camera pose estimation with directional learning","venue":null,"work_id":"2d06373e-7543-4ecb-922c-5d2cc4e33a21","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.530468Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:b1506eeb99d112153a428eab17508462b13ae6a64d9e7fdc0e7f905d70f1144f","observation_id":"86b2f14c-774d-422f-91d3-3d6aef508027","resolution":{"observed_at":"2026-08-11T10:49:19.137544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:19.102914Z","title":"Chang, Manolis Savva, Maciej Hal- ber, Thomas Funkhouser, and Matthias Nießner","venue":null,"work_id":"51a7b658-e7e3-4f4b-b9a6-2da75cfe3865","year":2017},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.535852Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:4d75d01943cb13321fffc59cfff2b2d2ce46fde70d2f218159f3bcc121683d3e","observation_id":"ec189007-980b-492c-810b-1ff9d789ba5b","resolution":{"observed_at":"2026-08-11T10:49:19.111534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.546260Z","title":"Stochastic video generation with a learned prior","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.546260Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:c52dcd6cc937422ea6f16ea69875d2b796dd3f189cd7120c2dbac992b7c6b5b5","observation_id":"b450e6b0-d70f-4fe6-8cee-9edc2ba9a0d9","resolution":{"observed_at":"2026-08-11T10:49:17.546260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:19.055000Z","title":"Superpoint: Self-supervised interest point detection and description","venue":null,"work_id":"1decc620-1583-4d80-a957-0731a3102aed","year":2018},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.551777Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:e9e59a2717f26a6ba33b985136ae730af9c9faf4f0b30048f6fb1dc8892db204","observation_id":"eb90219a-daa1-4ac1-9cb3-1eed3573969a","resolution":{"observed_at":"2026-08-11T10:49:19.070438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.558355Z","title":"Random sample consensus: a paradigm for model fitting with applications to image analysis and automated cartography.Communications of the ACM, 24(6):381–395, 1981","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.558355Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:eadbceb5fbf785698bc9f1427dfdcbafd913d60ab54d288f872b0fc26d1ba3d1","observation_id":"bae2a73e-bb43-44c4-ac48-de5690c9d20c","resolution":{"observed_at":"2026-08-11T10:49:17.558355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.565517Z","title":"Photorealistic video generation with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.565517Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:68a1533b3aef951ff237c20cc22ff4d71acad4a55b3079fa6a677080a5306745","observation_id":"7aa04694-dc71-44e9-9eb5-583bd9735aa8","resolution":{"observed_at":"2026-08-11T10:49:17.565517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.982398Z","title":"In defense of the eight-point algorithm","venue":null,"work_id":"f34e737e-e61a-4398-a93d-757109d8f1e8","year":1997},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.571855Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:7cacfdb36d83de361395b810c4a14a6d02add2f1ceec87c605237860386c5557","observation_id":"ff3a9dd0-479c-4d53-96a5-6d5b686c5a67","resolution":{"observed_at":"2026-08-11T10:49:19.013509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.576582Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.576582Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:294bc51f26bd35db274b6397e206cce462650b0b373b69182010cf0044a9faff","observation_id":"f9cbb8a0-0342-4be2-95d7-434fc1fba212","resolution":{"observed_at":"2026-08-11T10:49:17.576582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T10:49:17.581194Z","title":"Imagen video: High definition video generation with diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.581194Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:53f4849539e7adbd2e380f562474f27f9d60dd8501184965782a76a745f35a50","observation_id":"935ba347-e76b-4067-ba11-327c237604e5","resolution":{"observed_at":"2026-08-11T10:49:17.581194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.587406Z","title":"Video dif- fusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.587406Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:db5cd80882c69b87adac26de2081dbeefd13cfb3c78c7270997b63b2bd469d95","observation_id":"ff2c4a90-51e4-483a-93e4-823a25f41aa1","resolution":{"observed_at":"2026-08-11T10:49:17.587406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.901653Z","title":"Learning to decompose and disen- tangle representations for video prediction","venue":null,"work_id":"a8a96a45-5d3f-40b1-b2dc-c4e4e018fe55","year":2018},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.593505Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:8aa3623bae0599c0412e2e204ce61cbd759982a70920b0f91a339a952a5ad083","observation_id":"9de73a31-26f4-4de3-a5bb-459152883b6a","resolution":{"observed_at":"2026-08-11T10:49:18.908105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.884108Z","title":"Navi: Category-agnostic image collections with high-quality 3d shape and pose annotations","venue":null,"work_id":"81a2f9ca-f687-4e83-a169-ffac884f4a9e","year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.603045Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:a7eba8e824359992fa03b59d7f8d8aa8bee6f667643a52e39d732f31435e2ec1","observation_id":"41365cb5-0789-4507-a16a-57a8ab25d9e3","resolution":{"observed_at":"2026-08-11T10:49:18.888451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.607434Z","title":"Omniglue: Generalizable feature match- ing with foundation model guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.607434Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:e9e98116b7fa5af6f8abe070c255d7384ad5f2a0c9e3d53532bc34d46481ad1f","observation_id":"0ea273e9-0b7d-4d46-8823-bd6ba2c1501a","resolution":{"observed_at":"2026-08-11T10:49:17.607434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.843635Z","title":"Image matching across wide baselines: From paper to practice","venue":null,"work_id":"b29abc83-ea5e-4f49-8673-eec12145065b","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.612809Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:17f91c9d42dfb6c11c16a05275c9df7c09f917b9a5437c845b6d7607eb7c1054","observation_id":"6a738045-8beb-48a3-80f3-17495cc7f690","resolution":{"observed_at":"2026-08-11T10:49:18.852551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.815010Z","title":"Lfm-3d: Learnable feature matching across wide baselines using 3d signals","venue":null,"work_id":"2096f5b5-fd42-46d2-9ecf-cabe69173c69","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.617461Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:dc5f0ebee176a89ad1be69f94683142cfe79982f08ca7167a22d556100c6dcd8","observation_id":"5b8b5f44-38f9-483a-a890-88678c3bb44c","resolution":{"observed_at":"2026-08-11T10:49:18.821660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.625244Z","title":"Posenet: A convolutional network for real-time 6-dof camera relocalization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.625244Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:33791eebe6c01f15646c03e77863d1c7c0a25366b5c6cf020b1753c6dabc2775","observation_id":"e6d41526-004b-4ca9-bf1a-b24b80debca7","resolution":{"observed_at":"2026-08-11T10:49:17.625244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.770295Z","title":"Kling ai, 2024","venue":null,"work_id":"71b15843-7994-4785-8ed2-0ad82eeb681b","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.631587Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:bb5e91b33bddfd0a6ff9acbb9f0ed5cc58c8c449a9f87ec40dfc1ddd2e743714","observation_id":"a14377f9-dc89-4c0b-9e52-d68bfc629f6c","resolution":{"observed_at":"2026-08-11T10:49:18.780489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01523","last_updated":"2018-04-04T17:55:40Z","snapshot_observed_at":"2026-08-16T16:05:25.921493Z","submitted_at":"2018-04-04T17:55:40Z","title":"Stochastic Adversarial Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.01523","snapshot_observed_at":"2026-08-11T10:49:17.640648Z","title":"Stochastic adversarial video prediction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.640648Z"},"links":{"cited_paper":"/paper/1804.01523","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:1f5db501f749b773e0a0de1913396c84c2176276a4a01daa35ac871bad691455","observation_id":"f6266d70-efde-40a4-b745-5f870e3ce202","resolution":{"observed_at":"2026-08-11T10:49:17.640648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.646626Z","title":"Ground- ing image matching in 3d with mast3r","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.646626Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5fd67cfe15e40957aadf284b222216e4440ade2f8c7053d4b037dd19d266d13a","observation_id":"2528ef87-4a05-4791-bace-d962ddb45069","resolution":{"observed_at":"2026-08-11T10:49:17.646626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04926","last_updated":"2023-12-18T15:49:22Z","snapshot_observed_at":"2026-08-16T15:34:42.243779Z","submitted_at":"2023-05-08T17:59:58Z","title":"RelPose++: Recovering 6D Poses from Sparse-view Observations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04926","snapshot_observed_at":"2026-08-11T10:49:17.650702Z","title":"Relpose++: Recovering 6d poses from sparse-view observations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.650702Z"},"links":{"cited_paper":"/paper/2305.04926","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:2b6bee8d21c765ef8af2cf66ba5454dd8067a0dcd3074ff70e612ca7261e2269","observation_id":"31faefcc-c490-4c48-85e1-af58ef399b0d","resolution":{"observed_at":"2026-08-11T10:49:17.650702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.728496Z","title":"Lightglue: Local feature matching at light speed","venue":null,"work_id":"37496274-548d-47c5-b78a-f4e5508f8102","year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.654995Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5b0261fe9ba40a9bd65c3be6207fa470bad85f2bc197780a56667c17ff0560ad","observation_id":"c193beb4-1178-4934-906b-89e2314f5c54","resolution":{"observed_at":"2026-08-11T10:49:18.741801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.697561Z","title":"Dl3dv-10k: A large-scale scene dataset for deep learning-based 3d vision","venue":null,"work_id":"71764af2-a23e-4061-9770-bb7bd72b3ca1","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.660554Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:8cc9f8be5aa802402a51dd388a519dd6bf36670f8c6db9bbd499e99c0bb52f19","observation_id":"7bfb523c-cb8d-4e0a-9dc9-0607f74f02c9","resolution":{"observed_at":"2026-08-11T10:49:18.710432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.663939Z","title":"A computer algorithm for reconstructing a scene from two projections","venue":null,"work_id":"59dc18d4-7280-4d8d-afc2-1bc7f94fab87","year":1981},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.666090Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:bfdd9e4412bfe6e7862711cfc5cfcc20955ab2d9968d9484443690e5e79fb88c","observation_id":"f35a3c7d-d50a-4626-a88f-d89cfe7e918b","resolution":{"observed_at":"2026-08-11T10:49:18.676011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.641488Z","title":"Distinctive image features from scale- invariant keypoints","venue":null,"work_id":"b3542f3f-ce7e-444e-8a67-d740010008a1","year":2004},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.670902Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:fc2311fd85ad69bbd8e765930fbc129a9b0d9bf35207fb1cbdbd1a3dfcc68ce2","observation_id":"919e4b15-45b3-4b55-8042-fe77447e4d3d","resolution":{"observed_at":"2026-08-11T10:49:18.648600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.619480Z","title":"Luma dream machine, 2024","venue":null,"work_id":"679bbc2a-59d4-47c5-8553-644dfe498545","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.679232Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:d707bd4358d16439da372e704d3124e3ec76a49e6720feca29515be2e0c44d36","observation_id":"e979f024-d312-4751-bc29-4c9ada45e8be","resolution":{"observed_at":"2026-08-11T10:49:18.628142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.602437Z","title":"Fast approximate nearest neighbors with automatic algorithm configuration","venue":null,"work_id":"2c96b025-3724-4d74-a7cb-a6419acdcb90","year":2009},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.689492Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:8592ded6becb46e83f857dbc9e9cd6b2d1bfe7f827dd25539e1e7b0f647bd0af","observation_id":"a85bc594-7e93-4f0d-9f8c-33e2115943c2","resolution":{"observed_at":"2026-08-11T10:49:18.607478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.575353Z","title":"An efficient solution to the five-point relative pose problem","venue":null,"work_id":"7e3e5df1-161d-4d77-8390-43297bb7dc8c","year":2004},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.695020Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:d2e2ca925316ea0ecf8c86f663a3ed8113824a57026c56fd0e41b1290d8239e2","observation_id":"cecaec35-d467-4a53-95e1-9f4443a1155f","resolution":{"observed_at":"2026-08-11T10:49:18.583348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T10:49:17.703922Z","title":"Hierarchical text-conditional image gener- ation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.703922Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:007c947d96629651b1ae560707ed5289846be8017932817748a3191bbe94da39","observation_id":"23d07844-11dd-4e02-807d-59a88419ab2a","resolution":{"observed_at":"2026-08-11T10:49:17.703922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.551596Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"931db734-4fe5-43dc-8f74-bbd23d44d77a","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.712524Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:da7cdfe00ead21f66d43f4cbcf7eccb46ec20c64b7f66db549c7608f741d2ce7","observation_id":"b306ca2f-45ce-494b-b249-5a72fcba2348","resolution":{"observed_at":"2026-08-11T10:49:18.558200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.717377Z","title":"Orb: An efficient alternative to sift or surf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.717377Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:21a866fd42e5cd37b59b9f54b4330449f8460248aba235acaff9c8862ac0a68c","observation_id":"1eff6048-7eac-44b3-adf5-037eefe3fef5","resolution":{"observed_at":"2026-08-11T10:49:17.717377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.523412Z","title":"Tools for human imagination, 2024","venue":null,"work_id":"8c0c77a5-4bdb-4be0-81bb-4be45f505444","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.722583Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:a1c2d5d033a50cda70bc6909cbda9936fd1951cf01bb914287dc49aa630386fe","observation_id":"f62f27af-af99-44f2-a658-1ad8220e5313","resolution":{"observed_at":"2026-08-11T10:49:18.528952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.727119Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.727119Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:b6b27aaac76e9b86d8a9ea0286772c05ea6b4f58af7daa2013af2896af9e462e","observation_id":"b94a6a4c-d03a-4b0a-9235-b56b3e855f86","resolution":{"observed_at":"2026-08-11T10:49:17.727119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.731264Z","title":"Tempo- ral generative adversarial nets with singular value clipping","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.731264Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:0f49a0c182f00a08834951f59eb1c167ca29c5903fbccb45cb9113ce0c305fad","observation_id":"e543099d-c1aa-4e59-8fd9-b28c08b97244","resolution":{"observed_at":"2026-08-11T10:49:17.731264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.470712Z","title":"Superglue: Learning feature matching with graph neural networks","venue":null,"work_id":"6460f0ff-6281-429a-9c74-65b20b1b2d10","year":2020},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.736647Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5452bb8b066b974235fe61890e88435b3e7b07f0b1b9b17f3d031c16ceb209ad","observation_id":"74250d5d-4e55-417d-b716-acb718da20c3","resolution":{"observed_at":"2026-08-11T10:49:18.481984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.742982Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.742982Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:ef7cee597010170cf2b3d96ac6b4429cb68e6534f6d15080878cd33dea77236a","observation_id":"25823814-c230-4f40-ab77-d9ba4ac8fffd","resolution":{"observed_at":"2026-08-11T10:49:17.742982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.442336Z","title":"Pixelwise view selection for un- structured multi-view stereo","venue":null,"work_id":"a19ca7b0-d617-475d-8f04-2dcda13bbac3","year":2016},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.750111Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:d67101b22fd54cad06ed4fc38cc507f8e9437afc97789ee640539ce44010fba3","observation_id":"67d2ba6f-1ea6-4d29-874a-cb8c5a7a16ec","resolution":{"observed_at":"2026-08-11T10:49:18.448483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T10:49:17.755033Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.755033Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:46d01f883b90814c19140b697ae9a286aeda5b9020679d1c97445cec27b7d2dd","observation_id":"879d032f-86da-4af9-91bc-1d32f6043c51","resolution":{"observed_at":"2026-08-11T10:49:17.755033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.760814Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.760814Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:bd45477e4666f57edf72bd59961f5735e26157fb62d7f2bef75b5253e1b55479","observation_id":"4bf54e73-966e-4f62-868e-fceef08517d8","resolution":{"observed_at":"2026-08-11T10:49:17.760814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T10:49:17.765124Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.765124Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:0de633ef136f2a7eaf49a56fca1a27718eae8a5c84d7fecbe6d45aa3b1489d0f","observation_id":"2ea0ebfb-bfa7-4d40-bd81-01c6e6f95cca","resolution":{"observed_at":"2026-08-11T10:49:17.765124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.406416Z","title":"LoFTR: Detector-free local feature matching with transformers","venue":null,"work_id":"32904373-f553-4c12-a23b-4acc25b82767","year":2021},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.771526Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5a3e533139777c3c52016825071936adbc3d83246238eced3857aae4d8db5c28","observation_id":"5dc5995c-2b76-42db-90c5-58ed408ef660","resolution":{"observed_at":"2026-08-11T10:49:18.412040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.386804Z","title":"Quadtree attention for vision transformers","venue":null,"work_id":"a857ccc1-5298-424f-9cbd-35ea78d01f8a","year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.778200Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5f6a08cde08c4324685881ab710ec061614ac2d480007f3577934be112220649","observation_id":"74b85558-954d-4612-bc63-89c24e936795","resolution":{"observed_at":"2026-08-11T10:49:18.391886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.785605Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.785605Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:1dd2e71f1a42130372a3e83ce064325c1d3b1f674c7c5ddce0875b24953fa235","observation_id":"491ed1bf-2db5-4429-97d5-fd5db80a3600","resolution":{"observed_at":"2026-08-11T10:49:17.785605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04993","last_updated":"2017-12-14T00:04:02Z","snapshot_observed_at":"2026-08-17T13:24:58.652302Z","submitted_at":"2017-07-17T03:42:17Z","title":"MoCoGAN: Decomposing Motion and Content for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.04993","snapshot_observed_at":"2026-08-11T10:49:17.792720Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.792720Z"},"links":{"cited_paper":"/paper/1707.04993","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:2737dc1b643ba448712f11203969f6ba2a8638faa84e6ce4a7088e88b4932707","observation_id":"5fc0373a-2c5d-4d07-8839-ec83952bf55c","resolution":{"observed_at":"2026-08-11T10:49:17.792720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.358852Z","title":"Disk: Learning local features with policy gradient","venue":null,"work_id":"0d8bf053-6422-463a-8e47-d8d6cabded56","year":2020},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.798613Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:21eba985ebfc748b1b09adc1a2a1a8573231e9cf7038521411525704b2150a9c","observation_id":"59c71db7-8e2c-46a5-ad58-5b4cee27da59","resolution":{"observed_at":"2026-08-11T10:49:18.364602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.335096Z","title":"Hier- archical long-term video prediction without supervision","venue":null,"work_id":"81e3e2af-76aa-4f94-8e85-686bb2dd6a99","year":2018},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.811672Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:4134871937c9d5b09960c5e135a7a78ad68884fb1c7ef89e2dd3faa969e0638d","observation_id":"1d52f639-fea1-4700-afeb-f7d51195ebe8","resolution":{"observed_at":"2026-08-11T10:49:18.339826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.819586Z","title":"Phenaki: Variable length video generation from open domain textual descriptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.819586Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:043fdb6449ebfd217d0157af893fc1fbd5286933dc2bec292132145e2c6d470b","observation_id":"a9fddcf4-5994-4d27-9b81-40215279ff38","resolution":{"observed_at":"2026-08-11T10:49:17.819586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.297926Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"bdab62d5-9a1a-4254-98f9-abc5ae86c2ce","year":2016},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.824576Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:dd5500147e9e5d246d29730f49ccb91d7077e326a02071accb275e6bec4f1caa","observation_id":"4ffafcbc-9541-4500-ac18-dd5f7f404415","resolution":{"observed_at":"2026-08-11T10:49:18.308426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.269666Z","title":"Posediffusion: Solving pose estimation via diffusion-aided bundle adjustment","venue":null,"work_id":"ab5878fa-0f73-423c-aa41-ce46b8e8ed26","year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.830318Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5e9b7a3227e8e78fa8d646cae376f8c05fbfc315f1eaa49c742d5eaee3be7e93","observation_id":"2e2cc559-bec0-4825-8e2d-6a62f47a4392","resolution":{"observed_at":"2026-08-11T10:49:18.279292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12024","last_updated":"2023-11-23T17:59:42Z","snapshot_observed_at":"2026-08-16T14:41:45.064723Z","submitted_at":"2023-11-20T18:57:55Z","title":"PF-LRM: Pose-Free Large Reconstruction Model for Joint Pose and Shape Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12024","snapshot_observed_at":"2026-08-11T10:49:17.835071Z","title":"Pf-lrm: Pose-free large reconstruction model for joint pose and shape prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.835071Z"},"links":{"cited_paper":"/paper/2311.12024","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:5d6bb0e2f78af71523e559231ad15365b517ab9bb4dfc2918bbec537988eca00","observation_id":"bc896f16-244e-4a54-85be-b4cbd5cc562f","resolution":{"observed_at":"2026-08-11T10:49:17.835071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.246633Z","title":"Dust3r: Geometric 3d vi- sion made easy","venue":null,"work_id":"fbf7c1f2-116a-453a-b698-04652776e5b3","year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.840396Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:f1a25c0e6465ba28483109114bbbb482a1b61ae379f01ce7b704e266aa31d231","observation_id":"dcb43e44-6264-418b-989c-2fdc15958cdc","resolution":{"observed_at":"2026-08-11T10:49:18.252474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.226829Z","title":"Croco v2: Improved cross-view completion pre- training for stereo matching and optical flow","venue":null,"work_id":"402d0c87-03d1-4f7d-b88d-0fe27a29a89d","year":2023},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.848625Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:ead75450a3dda14068990c9333789b159ce1c858b48bfae5c66e80275e68b914","observation_id":"930b9b8a-3a6f-4b72-8347-27f3c55dedcd","resolution":{"observed_at":"2026-08-11T10:49:18.233516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:17.854801Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.854801Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:31d5d5bc0daec15c6e2557e0f8afd8839dcf4abdd1836b23387697625a789030","observation_id":"75da0a9e-e2d8-494d-8fd4-38d2b9a08421","resolution":{"observed_at":"2026-08-11T10:49:17.854801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:49:18.191984Z","title":"Rel- pose: Predicting probabilistic relative rotation for single ob- jects in the wild","venue":null,"work_id":"819de172-a99a-40de-9cd5-225aa1d305cf","year":2022},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.862518Z"},"links":{"citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:276606fb17757cd1efa053f95b229875d9102fcc1131a4e86cbcf011e16c80b9","observation_id":"04485ba5-4f53-4653-8e50-12d94d3fd1db","resolution":{"observed_at":"2026-08-11T10:49:18.202403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14817","last_updated":"2024-04-04T16:27:06Z","snapshot_observed_at":"2026-08-16T14:16:07.149885Z","submitted_at":"2024-02-22T18:59:56Z","title":"Cameras as Rays: Pose Estimation via Ray Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14817","snapshot_observed_at":"2026-08-11T10:49:17.868077Z","title":"Cameras as rays: Pose estimation via ray diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:17.868077Z"},"links":{"cited_paper":"/paper/2402.14817","citing_paper":"/paper/2412.16155"},"observation_digest":"sha256:f60557dd3741e54d21bdaf860573b0a9ff888b427e14b70060bff22a28fe3bd6","observation_id":"a05e2aa0-724b-47f6-84cb-482b1bc5a1be","resolution":{"observed_at":"2026-08-11T10:49:17.868077Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.16155","last_updated":"2024-12-20T18:58:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:25:50.342607Z","submitted_at":"2024-12-20T18:58:24Z","title":"Can Generative Video Models Help Pose Estimation?"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2412.16155."}