{"as_of":"2026-08-14T15:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:343fa106699159de995084155c3a568e5cabde2d14ccddc419925067f1c6f7a1","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T00:56:18.867382Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09024/citation-record","integrity":"/paper/2607.09024/integrity","json":"/paper/2607.09024/citation-record.json","paper":"/paper/2607.09024"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07280","last_updated":"2025-06-10T11:37:10Z","snapshot_observed_at":"2026-08-12T22:11:59.302187Z","submitted_at":"2025-06-08T20:52:34Z","title":"From Generation to Generalization: Emergent Few-Shot Learning in Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07280","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2506.07280 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2506.07280","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:d80630d56c4b41d767078f079ed124ab2ca04d835d967fcbcdb7d874eb0b649b","observation_id":"46f2b52c-3de1-473c-9ffb-ab0dfdc56485","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in Neural Information Processing Systems37, 61872–61911 (2024) 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:f618124aa27f91526488b2e02cedb6d245fc3f035a37a6d86626104b9b4f725b","observation_id":"df198e50-7374-4026-9ee1-ca56760e38f7","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1bbe31156177ecd7c7643cb4018d0a740d1051da7152453a612f7e531f7688cc","observation_id":"e2649b28-43be-48d2-ba22-e0d0bf1302f5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-14T14:35:29.440022Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.08471","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2404.08471 (2024) 2, 13","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2404.08471","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:80dfbdb89daa9a4b0156c23118cb588d0330a63ac20f67584e13023d7d065e1f","observation_id":"3abcb894-b659-47dc-9789-76ed66baade5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.12867","last_updated":"2022-01-06T11:45:09Z","snapshot_observed_at":"2026-08-13T17:09:09.364928Z","submitted_at":"2021-12-23T22:27:55Z","title":"HSPACE: Synthetic Parametric Humans Animated in Complex Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.12867","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"org/abs/2112.128678","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2112.12867","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:ebb403df5d0cd2ef85098e191c0869b27606257fc08d74a0bc41e6a3d7bafca7","observation_id":"05d88bf4-f476-493b-b396-ae9b1a7e80a7","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11427","last_updated":"2025-04-15T17:39:07Z","snapshot_observed_at":"2026-08-09T05:53:39.258466Z","submitted_at":"2025-04-15T17:39:07Z","title":"NormalCrafter: Learning Temporally Consistent Normals from Video Diffusion Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11427","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2504.11427 (2025) 4, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2504.11427","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:12d96ea379c8c7f2743928ce98efb207d470086a19880c420fd985a2eea45865","observation_id":"24e2e1f6-3289-4856-8f65-717a446a7b73","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:95906c77a9a26be9c0fa97a7c3f429ad99204e06e00b93a97d0c1e4b66893672","observation_id":"59e80ac5-d19a-4121-90d3-2830f7cee1f3","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in neural information processing systems33, 1877–1901 (2020) 3","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:050c32ec63c0a6faa0e4e9f2c457d8b4d9897b84a35f725ba1b07d7f34cea0ae","observation_id":"ce2c13f8-f005-43d5-976b-93cc77e321af","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:cbdf4a58cd777ace40cb4b9a9ac72d1f02cf1c873bdc2a58e353a95247506960","observation_id":"dd3bb213-52db-44be-be70-8cb564e074c7","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16719","last_updated":"2026-03-28T16:54:56Z","snapshot_observed_at":"2026-08-07T05:59:39.049027Z","submitted_at":"2025-11-20T18:59:56Z","title":"SAM 3: Segment Anything with Concepts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16719","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2511.16719 (2025) 1, 2, 3, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2511.16719","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:7e26471561af80d210523f094c090bd7626bc06d0345f9cf0f5a64801dbc12de","observation_id":"63678d3d-0f6e-4ca9-b489-6c30de51d3e5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:bf93afd1950f6b427934f6838d1907e46fd6a3fc12e10d66cd0e3278c5c08096","observation_id":"1d63bf22-c443-4e76-af7f-063eb2e40780","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:c2d3936c7f34ed7ea093dd637e8a0e93217acd32d1908da98b20a0076f15593c","observation_id":"faf4feaf-07f4-4faf-857f-6c84300d950c","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:477c579280f142041ccc3aff08a5a3ec07e30f6e1934268a19c7dd23d13ce758","observation_id":"b4896612-c9d1-4705-a45b-eeda5a5ed296","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:2bc7f0f1b441fa3bf9831dd1311a8ad2558f3c652a2931e4ab45d6a7fc96643a","observation_id":"fa4fc8d4-8e4e-4f43-89d9-9145be9f5c94","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:204bf25afff0918caa74f067ed1eb8e928450a77383e77716b87829a2c41a85a","observation_id":"23a90ece-fdcb-498b-a98d-4a403ef68d8e","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Forty-first international conference on machine learning (2024) 6","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:85c3b8e67fe84814a283fa16e86cb8fdc68d27f30a6b8fef4642cc4e65c9eca0","observation_id":"3b29b38d-0bcf-43aa-a845-370ff61a356d","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: European Conference on Computer Vision (ECCV) (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:ae981d29ab7d3f4848f55c3df2d09766db8a573d643b0cf3fe62ea861669ad5d","observation_id":"d3866ee8-a48f-4cb4-b5b7-d8676c3f3c2b","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20329","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2604.20329 (2026) 5, 9","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2604.20329","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:6993ffed9507ee301c67f148c6adac1dacfc8df71043a679dedbc02e341c6d1b","observation_id":"5631ba55-81a8-4676-a702-c623c2fb9003","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:53f5c22192744d80f26321e121647fb363eea48b776e8f4aabccc504f7795886","observation_id":"09cd76cd-3399-4940-a23a-4e7d26103c76","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:ef0262ed95278ca80096b0e013a0250487e40b6f341b60490ae5b1c9fc66b9d6","observation_id":"0fc70e05-2f21-4466-9ba1-4b76e2ea3728","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"The international journal of robotics research32(11), 1231–1237 (2013) 11","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:5af232b6322af88c5dfc31061970c47811e3815faa975176e458655ce51f6af7","observation_id":"6e3893fd-ab16-4dc5-a32c-48921804461a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01030","last_updated":"2026-05-18T02:06:07Z","snapshot_observed_at":"2026-08-07T19:28:53.049339Z","submitted_at":"2025-11-30T18:57:25Z","title":"Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.01030","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2512.01030 (2025) 3, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2512.01030","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1a5a50df79edcbe72f8858ff1a79533751cb158393d85839894da01bad3966d8","observation_id":"8753e497-42e3-44ba-ac64-de87a2a702a6","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:56336ba7815546cbd6cb6c5498d666e989c5e4382a8184baaabde6970ab509c4","observation_id":"41d2635f-c791-44ca-a813-26a28f2f421e","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"org/abs/2006.112396","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1d92598d80088d80e2cdf5b9eeadeccb7ad949a14496e6160f8da8c739677ee7","observation_id":"53012cfd-3327-4c05-98b1-87ac8434e598","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02095","last_updated":"2024-11-27T07:59:25Z","snapshot_observed_at":"2026-08-12T22:52:07.327467Z","submitted_at":"2024-09-03T17:52:03Z","title":"DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02095","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2409.02095","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:bbb6d047d92d4e7fafaa16d635434fb8b1c1e3cc9ae3899f938536b7d94e51d2","observation_id":"a087af19-e580-421e-a627-7d7fe27d2299","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2512.07831 (2025) 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:6f1f796cadc34c43ea6d6b2150436a5b81023bd8f54afd8242dff1fc52b39f53","observation_id":"057785f3-a81d-468f-a587-d6bb1def0b18","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:dc63421bf2dbbada2ad0d525012e2e5870027ffd39b08c1604aea1fd0f73c625","observation_id":"e3f469a3-544d-4b9b-8e1b-8268693b4c01","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07961","last_updated":"2025-08-19T17:06:41Z","snapshot_observed_at":"2026-08-07T16:06:45.889516Z","submitted_at":"2025-04-10T17:59:55Z","title":"Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07961","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2504.07961 (2025) 4, 7","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2504.07961","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:2432730e8c590a25344437b0989bb1cb21248d538d3102826a07796ffef6fb89","observation_id":"333f737a-c649-4dac-ac89-68a3b759856a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: International Conference on Computer Vision (ICCV) (2023) 11","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:e93a4545f5e80a5114621bee3bc0bdcd7e4167f144eac591a5971355ee36b164","observation_id":"d480ced8-caa3-4ec8-93d6-4721849f8d7d","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:9eb04efbd5b21fd6222bcf3182f97085228713f1b57953e6521fd20b6f15c6eb","observation_id":"3c5efaf4-3f78-42ed-bc77-55623eb30252","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:61163860e10a6bf8f5e025699c89a28bf639009f0a0286140b9a688eaada36f9","observation_id":"7b0d277b-89cb-4cb5-aafa-fd6f3964737c","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-08-14T05:03:26.544771Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2509.13414 (2025) 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:59b964fbc109ec76fc9f8bc01f513d8dabee14d5b8433957270693a9b3ba7ae0","observation_id":"523f5417-e211-42ce-aa12-b4f69a0876f6","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Leonardis, A., Ricci, E., Roth, S., Russakovsky, O., Sattler, T., Varol, G","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:42f2a411c7819e3628c6b45a5bc967483ad7c1ecde104e7fbc1bd43908897643","observation_id":"b439d091-43b4-4b1c-a8ab-145f3b2767a5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Asian conference on computer vision","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:a64ec528028185c7d382f584641d75370f8f1c4e00e24e1c4bf50d1616ca3673","observation_id":"fb070ba0-8b7a-410f-bad7-51554138b383","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:1412.6980 (2014) 9","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:d83aca5c2269c2c3187deaf07ce8c381bf579a557ba25ce15b414637a8aa25f6","observation_id":"385cbbf2-a152-45b0-8942-d9051267dace","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:f638e9ee2dab12c7e35f2ebc94548dd8a4da091bc2bb89d699893484fab6a6b4","observation_id":"95294dfb-f786-412a-be1d-53a08a19dbfc","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17249","last_updated":"2024-11-26T09:28:32Z","snapshot_observed_at":"2026-08-12T12:18:13.110960Z","submitted_at":"2024-11-26T09:28:32Z","title":"Buffer Anytime: Zero-Shot Video Depth and Normal from Image Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17249","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2411.17249","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:27de88cc5d976b5da21625708995a2e6676384e1a9c886468f156acefe8e4af9","observation_id":"c46a1f6e-6f13-4b8f-9a6c-98450bc7130f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01425","last_updated":"2025-05-02T17:59:55Z","snapshot_observed_at":"2026-08-14T06:29:38.967305Z","submitted_at":"2025-05-02T17:59:55Z","title":"GENMO: A GENeralist Model for Human MOtion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01425","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2505.01425 (2025) 2, 3, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2505.01425","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:61b44af194cea0597741c9e4e7ab9fc2476c6e61109273cff3ffbf53b1d2dcc6","observation_id":"bde40d8d-3abc-4c88-8dc5-378f0921d422","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:0c3e661cbddbf296077b95bdee02adac60f2e894727e874ce1b694d7e2133b7e","observation_id":"bf4c7601-7aa5-4eff-8a20-ac03b233c71f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18590","last_updated":"2025-03-22T20:49:08Z","snapshot_observed_at":"2026-08-14T05:56:56.814405Z","submitted_at":"2025-01-30T18:59:11Z","title":"DiffusionRenderer: Neural Inverse and Forward Rendering with Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18590","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2501.18590","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:6678b01613a60d316be4078d6d44fe0b70cb8fcde5b5cb7fb2a3b36bb6474d85","observation_id":"32a7def1-ae01-4436-8b8f-dde33814c562","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-07-06T22:35:46.018050Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2511.10647 (2025) 1, 2, 3, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:135b0acc3631027209973ba6e52dd3761835d8fba0924a5a447aa1b597b7d8e5","observation_id":"7bbd9e2d-be04-44f0-aebf-89e977fd075e","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:29344fb923fbd040fc9d57f329a9d65766464805d1f2ccae1128fcafa9b312f1","observation_id":"eebfe8e9-4eac-4bfe-a9c0-6f119e4799bb","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:4b779db479562c1a820423fb39ca24a25e3d23a1469d8e452307652611735695","observation_id":"8d62c2fe-2c85-4bb8-9871-77beda147deb","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2210.02747 (2022) 6","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:c3daea2b23b773a9e469df895095bed55f2c874cc85aea9c6d6e71c13eaeae15","observation_id":"e7bad297-4e7c-40d2-9efb-eadc425480b5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2209.03003 (2022) 6","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:3a4ac6cce4e3be99c80e688737f425c00d072eafca29f84bcbc46483a1eb7cf4","observation_id":"456fcaeb-d3d6-45ff-874c-88c0179ffcec","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:35a07e0754f91cc8d3fa47753af70b58d41620ee07084d86065680ab9872ad81","observation_id":"fb842aeb-cb1a-45a2-9a84-e4a825220287","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in Neural Information Processing Systems36, 58363– 58408 (2023) 3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:adf141dad123bc01b624dc1904aa7b669d37bfc12fdd359de8dba81b549161c3","observation_id":"3b364577-90b7-426f-a329-1dc9f45023b9","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2304.07193 (2023) 4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:bf62afa1180d69e1398668e44ef26c1838862e626e8790c1239fe076bb9a6867","observation_id":"78301d01-2d02-4a8c-9c85-2d6d4f80a667","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:234193aaa641144e8bcf342ec8020a7bcad9e3297a4423bce220f782940c2127","observation_id":"5e700313-f427-4409-9a04-acf6c6c8c4bc","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:c1f731b050a8f2e64226ef5c0f85136ee05afa0c55618503f2245697636728d1","observation_id":"03288838-d1df-43ef-97a6-0e6d77c840c6","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:cdf5a90cfaa4f14fec0dde4717018ca22150b0fa3e5aff71da6c0c059b6823f2","observation_id":"232f96fb-ab3a-4361-9c51-d3745d91844a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"IEEE transactions on pattern analysis and machine intelligence44(3), 1623–1637 (2020) 11","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:e3d69b82ff63b2503cd6b730e57055763e478e2f0fdc6c78e9f1c3c6fe2315eb","observation_id":"ea02bec8-aca7-491b-8944-a2b2fc7da32c","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2408.00714 (2024) 1, 3","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:28d86ed6d223cd1fb0c3f57ba4cbaba20af06ba17ef95a727c6a3d1baeb6d2f3","observation_id":"67a694d8-c7bf-4a49-8f59-071f671d7504","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:4388dfe09b87664afde35b9c22a169c42d16601fa27764188f93c809bc7ab068","observation_id":"89f9f7dc-568f-4858-97fe-5d42148eb97f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:8f64546c9d306823feb8741edeba578a672cebd0f6f6a88b2e6949c75840777c","observation_id":"15e48454-ed40-417f-8ffd-07c8be949f4a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15365","last_updated":"2025-07-21T08:17:41Z","snapshot_observed_at":"2026-08-06T15:31:21.700313Z","submitted_at":"2025-07-21T08:17:41Z","title":"DAViD: Data-efficient and Accurate Vision Models from Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15365","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2507.15365","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:589e42009a1f596d48820fcc55595f323d373f2f598df68c2372620f413adcc5","observation_id":"df15b44c-68d9-4506-b5ad-15320431b80f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:a64718d1d9e6d24a54b695dc29528de8a9f61c57bbb5870189fb6b820613104e","observation_id":"e25e0bce-44bf-4120-ad16-0be6408ef6ed","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: SIGGRAPH Asia Conference Proceedings (2024) 11 17 Video Generation Models are General-Purpose Vision Learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:dcce50f721f121d3c652c4ca0b33befb116118aa1a05080b051cfac6771849a7","observation_id":"e678c719-2113-4e23-b32b-80e5536b1b98","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-13T10:44:26.934833Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2508.10104 (2025) 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:85cc006f74aa2eb48cebffa600a2a56748215fcb7fee29bdfb091c42d0d3f4f1","observation_id":"8cd14e0c-6a0a-4cc1-9aab-c08e05334314","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: International Conference on Learning Representations (2021) 6","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:9408bd5e213ba715a1d9c40f9b8aa94e7ca64d45e88d4fd28201b992d2a6e231","observation_id":"f8b18b41-b1cc-42e2-ba7b-451f21b156ae","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in neural information processing systems35, 10078–10093 (2022) 2, 4, 13","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:e02da1a645786030ba2f4ebf1683d0b577229e3c1f25a1fa658573d651d4d61c","observation_id":"b669bf86-1a50-441e-87a1-ad75bf5d629b","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.21809","last_updated":"2025-08-29T17:43:58Z","snapshot_observed_at":"2026-08-14T00:13:29.854268Z","submitted_at":"2025-08-29T17:43:58Z","title":"VoCap: Video Object Captioning and Segmentation from Any Prompt","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.21809","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2508.21809 (2025) 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2508.21809","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:ef3f6d166fe999c6159e272004dfa688fde1801bdebab18987eeae48fe6b9daf","observation_id":"c1f47cb2-a1bc-4129-a261-406d0b614598","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2503.20314 (2025) 9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1212319c59ad5c776b1fd41905132e295602584962c1dd0817fdbfdc6640a117","observation_id":"eb54ce5b-fe02-46f3-8dd0-4c3aa3b1d3d0","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:ab35b0da98119e89762035b56ad4a10610b2826aac056b96dd01b67f47b1f653","observation_id":"bd76484d-79ae-41ca-947e-aa48fdfb73c4","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15195","last_updated":"2026-05-14T17:59:51Z","snapshot_observed_at":"2026-08-14T11:50:52.930098Z","submitted_at":"2026-05-14T17:59:51Z","title":"VGGT-$\\Omega$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15195","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2605.15195 (2026) 2, 3, 11, 12","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2605.15195","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:46856ea5c72695a27a476bc6945b4e1cabf4a2cdfbe2dbeb1b6c97199481a916","observation_id":"5794ff4b-4032-4b20-b929-b5586f1a5e22","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprintarXiv:2603.25892(2026) 4","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:68082c4719a61bbd13c16f0908a62f90585d3f3ec52e90f719a7976bcf6e9bc5","observation_id":"a31fc39c-0084-46dd-a4a3-6385f685aa8f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: 2020 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:6d5f2a03d2d19b4242a7c648ced021e9bf8f9a34094bc4afdb96f3861851c1db","observation_id":"762ef6d4-e269-438d-9be9-4bdce722da14","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:bb155483d6b4acf2944790b0f0cbb1ee4dd3e173c924d9d03ce42ac9cf440d49","observation_id":"f0d3bbaf-37ca-47cc-8cf3-73c5a1897eff","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2509.20328 (2025) 4, 5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:2e1a474fe55a19b983669fbcc369f664de065a6d5e600037eaedb513efa857e0","observation_id":"8e37c9d8-47b1-4b2e-aff0-3e4f726cd7f5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: CVPR (2022) 11","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:62c9b78567eeda34c9cbaad740c8e049ccfc2bbe424b62d20afcf218048840a5","observation_id":"18590aad-f3d9-4a8f-a80d-ac8302e3f676","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06090","last_updated":"2024-12-01T12:13:57Z","snapshot_observed_at":"2026-08-14T03:18:19.928426Z","submitted_at":"2024-03-10T04:23:24Z","title":"What Matters When Repurposing Diffusion Models for General Dense Perception Tasks?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06090","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2403.06090","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:947e19f2178e46f31e24f5c39d397c21eb0befa91db6b3c13ddb37f1706e0370","observation_id":"1c9d9c9a-dc14-4c5b-ba19-d24d263be397","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:58afbd1d8071ac96d1f49ec36715623d4b9f51711087c41702b53f28090e916a","observation_id":"e11c055e-67c3-43c1-a361-996caa4aa99a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:06d4441037af98a97a6600c58bf55a1c0c59e26135d841ffd4979280df0a79db","observation_id":"d9d5893f-6750-47de-b070-aedeb160f5a5","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10815","last_updated":"2025-03-12T09:16:59Z","snapshot_observed_at":"2026-08-12T22:23:26.150274Z","submitted_at":"2024-10-14T17:59:46Z","title":"Depth Any Video with Scalable Synthetic Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10815","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2410.10815","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:2e8df9a10d9088d217c381180d9633baa93f5ba7dea3a71784310043ee6bc656","observation_id":"1139947d-1420-4fa3-be16-9bd4d00c3b98","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1624a403f70c6b8892dc97026314ae4401d5a79f9cacb3140f2cd51b5e27934f","observation_id":"91d0549b-5d32-4294-b52c-e9195afdbe1a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in Neural Information Processing Systems37, 21875–21911 (2024) 1, 3, 11","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:1c9c356060a7cc5aeba86d13d88b2cfa3a9bc629a355df52586d4072b7c89014","observation_id":"1082eb65-55ef-45ef-8347-c9b1cd780b8c","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"Advances in Neural Information Processing Systems37, 21875–21911 (2025) 1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:8bcbac1f0f2a8b66e2abd12bae56cb225b2f37f13a317ed32864cfea7879c4af","observation_id":"bb32f305-3347-466c-9fab-babe1e83292a","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:9b75ef4c229bcb02b494cfdb23a11d668ff934cff9bd0248474ae54d2cd8eca6","observation_id":"006aa9f8-098c-44f4-9e24-fd8a1058790f","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Computer Vision and Pattern Recognition (CVPR) (2023) 11","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:007bd11a92a85a672c1f5039918d66c202c3ff96d018d1eb376ae2c93f6749c8","observation_id":"87293276-b681-4502-a85a-d5d4f51dd077","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:9351d9272820c858097194636d0b0191786cca7bf44c618c48e601ed0d757f19","observation_id":"c2735f94-4133-444f-b54d-defe1915a39e","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:7b2d546cd3ec6d5ce000abb9a90f0a356e379a1473932b30dae248130d8aaf6a","observation_id":"c6162dab-e909-428d-a761-e3e0a8f803fc","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2512.08924 (2025) 2, 3, 11, 12","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:4ee8bc662dc61de2369fa17ef7b2a0677dc451c4daab2dc3c0e8c23bb3cc0829","observation_id":"c1ca92e8-6a77-4db2-80a1-46700d7385dd","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"23345–23366 (2024) 7","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:3e2ed04326d568941f0c4cd296f00ab067944ae40a2b8a01f891c72bbec4b5f8","observation_id":"f9d16dc7-4545-4b4b-9fbe-64a242094f62","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2502.17157 (2025) 4, 11","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:244df4cf2f572ed8a9c458ee2b1a6a460a1100a7a44992ab8a7c7c734869e8f6","observation_id":"0975dc7b-8ee3-47f5-8802-b598c8b84384","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:b2314469985b97b507b81be5d388da462cbdbbd3940bc070c08803da48ae1f8c","observation_id":"9ade3979-a485-4960-abbc-f9f222f3be1d","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:d1d17026987b4102895c123a65e3a78a735631917b23cd9f56c9d42a27196c61","observation_id":"e6b6b15f-52d8-4796-8ae2-63049ff1a72e","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13684","last_updated":"2026-04-21T13:13:49Z","snapshot_observed_at":"2026-08-13T23:42:55.696432Z","submitted_at":"2025-12-15T18:59:48Z","title":"Recurrent Video Masked Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13684","snapshot_observed_at":"2026-07-13T00:56:18.867382Z","title":"arXiv preprint arXiv:2512.13684 (2025) 4 19","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-13T00:56:18.867382Z"},"links":{"cited_paper":"/paper/2512.13684","citing_paper":"/paper/2607.09024"},"observation_digest":"sha256:c562daeb439a794e3916392932e6537cf0a3c5542db5194d758a4f80ddd9681f","observation_id":"fee7102b-d4d0-49e2-80ae-591a188e3128","resolution":{"observed_at":"2026-07-13T00:56:18.867382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09024","last_updated":"2026-07-10T01:09:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:06:22.795281Z","submitted_at":"2026-07-10T01:09:06Z","title":"Video Generation Models are General-Purpose Vision Learners"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2607.09024."}