{"as_of":"2026-08-12T04:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b9b229545b1d9a257bff5f23ee834413cf2a28aeb0a968b61455a7e552203d9a","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:36:53.235740Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":104,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T01:00:03.100466Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":93,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:fea6eeca6d2de47d6ba605c10b48e38a5e6b84c2fde11fdcd395222921aad2ce","observation_id":"01890349-770e-4c2c-9b11-0c15604e7c9d","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:f46f2e7480578b1d1d1861df0b95aca8a553c3d157c309217fb951ef2f8e13f9","observation_id":"dbc082f8-2ef1-41da-babd-92fd7526efe7","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-05-17T03:27:58.952076Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2310.01852"},"observation_digest":"sha256:0958a57f48c9ba42773c7ff100a763f20e8a89181dfca5e88c84ac927e102599","observation_id":"d0657f60-4e87-4833-8595-c8a29637bd6c","resolution":{"observed_at":"2026-05-17T03:27:59.069687Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2311.04400","last_updated":"2024-03-09T10:47:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-08T00:03:52Z","title":"LRM: Large Reconstruction Model for Single Image to 3D","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T10:11:00.777193Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2311.04400"},"observation_digest":"sha256:3976057cc39b5bbfa501321186032943bfca830062e921563aaa97563f7ce50e","observation_id":"5508df41-5c95-4f58-b5a3-c3927c243577","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:dc09adf421a127b178cd6ed9be941ed924ab3c53244faba5e38d23fcb47130b6","observation_id":"107448f9-83d7-444d-b0ef-af0b68ae0758","resolution":{"observed_at":"2026-05-17T20:22:35.048363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:6adbe395c0057f0f3a74d22c21db719fd81decf3c8b89eb3ef2d5cd9e19ea548","observation_id":"cf9a3d9f-a4be-44ef-8b03-2752a1e04304","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2404.08471","last_updated":"2024-02-15T18:59:11Z","snapshot_observed_at":"2026-08-07T02:30:11.447693Z","submitted_at":"2024-02-15T18:59:11Z","title":"Revisiting Feature Prediction for Learning Visual Representations from Video","version":1},"reference_index":287,"source":"arxiv_source","source_observed_at":"2026-05-12T12:40:23.709098Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2404.08471"},"observation_digest":"sha256:de30f9c6c50a2ad370aa7b99eb9a01a76252935be66f597eca45b4aef88bb55c","observation_id":"26568750-392f-4f45-b9e1-0dc79ca3b760","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-12T01:00:03.100466Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01820","last_updated":"2025-03-24T14:22:47Z","snapshot_observed_at":"2026-08-12T00:51:32.296639Z","submitted_at":"2024-12-02T18:58:04Z","title":"Towards Universal Soccer Video Understanding","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T01:00:03.100466Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.01820"},"observation_digest":"sha256:2352c7a32bf6ce8c22717a77fede5f2006b59344a63a4a34732a79d94baf0d68","observation_id":"4263e98f-201b-495d-b351-870236a8444f","resolution":{"observed_at":"2026-08-12T01:00:03.100466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T22:11:52.903306Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03758","last_updated":"2025-02-26T18:16:15Z","snapshot_observed_at":"2026-08-12T00:15:52.654846Z","submitted_at":"2024-12-04T22:53:56Z","title":"ARCON: Advancing Auto-Regressive Continuation for Driving Videos","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:11:52.903306Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.03758"},"observation_digest":"sha256:d4e34f40a239f0503efafbbc3e6cfbf088639b167e321e6e32b1a8c7d91f26a9","observation_id":"93b6d96f-b5d6-4e76-836a-478f3bef1e7e","resolution":{"observed_at":"2026-08-11T22:11:52.903306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T21:37:57.406762Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04273","last_updated":"2024-12-05T15:55:23Z","snapshot_observed_at":"2026-08-11T21:49:55.508827Z","submitted_at":"2024-12-05T15:55:23Z","title":"Reinforcement Learning from Wild Animal Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:37:57.406762Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.04273"},"observation_digest":"sha256:2ee08df8addc04ffb4b4c772abf4e5d17a911a86c06c4aadf138c0467b72d878","observation_id":"ad70ad72-bb83-4280-88b6-9b420e9f632b","resolution":{"observed_at":"2026-08-11T21:37:57.406762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T19:59:13.473248Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06182","last_updated":"2024-12-11T11:07:35Z","snapshot_observed_at":"2026-08-11T19:53:12.122785Z","submitted_at":"2024-12-09T03:41:28Z","title":"Towards Long Video Understanding via Fine-detailed Video Story Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T19:59:13.473248Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.06182"},"observation_digest":"sha256:e8b6c2f3e74c8d0a0d86fa8a00ea04ea1b80114b98f8dcab7e3e652dde493dad","observation_id":"69b91bbb-8d7a-4fc6-9e55-b0d424f983e9","resolution":{"observed_at":"2026-08-11T19:59:13.473248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2412.07584","last_updated":"2026-04-28T15:45:36Z","snapshot_observed_at":"2026-08-02T06:54:38.590926Z","submitted_at":"2024-12-10T15:20:23Z","title":"Multimodal Contextualized Support for Enhancing Video Retrieval System","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T07:14:34.843867Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.07584"},"observation_digest":"sha256:8d7be27404089d77b68d713ce8048a7037abfb7ab07f5ce653931979f1e1178d","observation_id":"1f529530-4988-48b5-a831-8c247a5de911","resolution":{"observed_at":"2026-05-23T07:15:28.445628Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T14:31:23.951045Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.11959","last_updated":"2025-02-12T13:25:10Z","snapshot_observed_at":"2026-08-11T19:08:39.712598Z","submitted_at":"2024-12-16T16:41:51Z","title":"Gramian Multimodal Representation Learning and Alignment","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T14:31:23.951045Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.11959"},"observation_digest":"sha256:b226c49945051a7bc94a75bee531471ea6aba354d8ae1c4d07ce6ca1669706f2","observation_id":"516ba0a7-066f-4d67-ba4b-452eaab05ab0","resolution":{"observed_at":"2026-08-11T14:31:23.951045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T13:56:48.343022Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12675","last_updated":"2024-12-17T08:44:29Z","snapshot_observed_at":"2026-08-11T22:08:06.971220Z","submitted_at":"2024-12-17T08:44:29Z","title":"ShotVL: Human-Centric Highlight Frame Retrieval via Language Queries","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:48.343022Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.12675"},"observation_digest":"sha256:fdd1966d7d85db7a4f17a2ecd7c88e220c98cd4e3c81a7147d2691adb80cbe99","observation_id":"31e0d036-f164-4b30-bb86-d74b0d0d4d93","resolution":{"observed_at":"2026-08-11T13:56:48.343022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T12:47:17.963301Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.13845","last_updated":"2025-02-24T03:37:59Z","snapshot_observed_at":"2026-08-11T14:35:32.643550Z","submitted_at":"2024-12-18T13:38:06Z","title":"Do Language Models Understand Time?","version":3},"reference_index":192,"source":"pdf_text","source_observed_at":"2026-08-11T12:47:17.963301Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.13845"},"observation_digest":"sha256:da3227bec925929e952d7e706909f9645fd6bb50cc60c89f9b8602346ccad825","observation_id":"a417401b-6c6e-49ee-a758-1f05bf83348f","resolution":{"observed_at":"2026-08-11T12:47:17.963301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T11:48:07.222604Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14965","last_updated":"2025-01-11T14:08:22Z","snapshot_observed_at":"2026-08-11T15:34:28.512673Z","submitted_at":"2024-12-19T15:44:04Z","title":"Movie2Story: A framework for understanding videos and telling stories in the form of novel text","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T11:48:07.222604Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.14965"},"observation_digest":"sha256:aa6dd04b340f90b3060877c8b4e126973ed9daea1b73432976eb6033be69e0ed","observation_id":"0ce6ac81-ac32-4b5c-ac18-878f9ed0616d","resolution":{"observed_at":"2026-08-11T11:48:07.222604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T05:29:51.387257Z","title":"Internvideo: General video foundation models via generative and dis- criminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17415","last_updated":"2025-04-07T11:20:37Z","snapshot_observed_at":"2026-08-12T01:27:34.957377Z","submitted_at":"2024-12-23T09:26:38Z","title":"VidCtx: Context-aware Video Question Answering with Image Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:29:51.387257Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.17415"},"observation_digest":"sha256:d1427e4ba0ed97d705a352afa6dcc86bef07e6ed07ca3daab63a0eb3aeff7703","observation_id":"527a5034-1726-4fac-984e-db07468774e6","resolution":{"observed_at":"2026-08-11T05:29:51.387257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-11T00:48:42.803699Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.19304","last_updated":"2024-12-26T17:53:14Z","snapshot_observed_at":"2026-08-11T00:41:31.136411Z","submitted_at":"2024-12-26T17:53:14Z","title":"Perceive, Query & Reason: Enhancing Video QA with Question-Guided Temporal Queries","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T00:48:42.803699Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2412.19304"},"observation_digest":"sha256:e8e373bb020685ce174c9d561337960925f2bb768dbcb8456ab830a27b295209","observation_id":"47ee8998-e4aa-4b7f-befe-9a345cd6ab89","resolution":{"observed_at":"2026-08-11T00:48:42.803699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:43d116a78c6f4794a279cdfbee8d41aa2696a31a39d850aeb4a15ecb5577d9fd","observation_id":"9489c8d4-380e-4e33-aee0-489b66a22283","resolution":{"observed_at":"2026-05-18T04:02:43.544903Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T21:23:58.007577Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-10T21:17:52.245219Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:58.007577Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:d96446c37c0cb182c6a950821854e7f06bd61048134f32fa9816d8edf8872297","observation_id":"8645d375-12b2-447d-bb3b-d448f37c19fa","resolution":{"observed_at":"2026-08-10T21:23:58.007577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T21:18:08.522588Z","title":"Videomae v2: Scaling video masked autoencoders with dual masking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.05453","last_updated":"2025-01-09T18:59:58Z","snapshot_observed_at":"2026-08-11T03:37:37.823382Z","submitted_at":"2025-01-09T18:59:58Z","title":"An Empirical Study of Autoregressive Pre-training from Videos","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:08.522588Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.05453"},"observation_digest":"sha256:257927c2d2245bd7c59bfb7a5a40b36103b413d62df689be78642bd432111785","observation_id":"c63646bf-f532-4508-ba8d-8831ca267467","resolution":{"observed_at":"2026-08-10T21:18:08.522588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T20:34:12.294304Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07972","last_updated":"2025-01-14T09:45:10Z","snapshot_observed_at":"2026-08-10T20:27:27.933657Z","submitted_at":"2025-01-14T09:45:10Z","title":"Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:34:12.294304Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.07972"},"observation_digest":"sha256:b77c11fe94e320cf480cb41fe679c3003875dce671866f61e134c7d8920d6164","observation_id":"3a3acdbf-0840-45e7-9e6a-ed3fd685817b","resolution":{"observed_at":"2026-08-10T20:34:12.294304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T20:22:28.840944Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.08771","last_updated":"2025-07-02T12:39:10Z","snapshot_observed_at":"2026-08-10T20:15:46.755789Z","submitted_at":"2025-01-15T12:44:52Z","title":"Admitting Ignorance Helps the Video Question Answering Models to Answer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:22:28.840944Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.08771"},"observation_digest":"sha256:2a9228fca31ca473745c986ae76f4b5896712ea3dfa8b811d7abb2df9facfe6f","observation_id":"a1bf4bc0-51da-4e06-92df-b148982abc98","resolution":{"observed_at":"2026-08-10T20:22:28.840944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T16:32:15.523468Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13066","last_updated":"2025-01-22T18:21:55Z","snapshot_observed_at":"2026-08-10T16:25:37.177679Z","submitted_at":"2025-01-22T18:21:55Z","title":"SMART-Vision: Survey of Modern Action Recognition Techniques in Vision","version":1},"reference_index":173,"source":"pdf_text","source_observed_at":"2026-08-10T16:32:15.523468Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.13066"},"observation_digest":"sha256:5e72ea47eab50f8eaf70f26dc18621fdf5ff6834eef4446a66be9347840f8b7e","observation_id":"0c5358da-12bd-4211-8196-7cbcf3e17854","resolution":{"observed_at":"2026-08-10T16:32:15.523468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T15:56:37.656464Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13536","last_updated":"2025-01-23T10:35:22Z","snapshot_observed_at":"2026-08-11T18:26:40.310791Z","submitted_at":"2025-01-23T10:35:22Z","title":"ReasVQA: Advancing VideoQA with Imperfect Reasoning Process","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T15:56:37.656464Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.13536"},"observation_digest":"sha256:9c647065309592b51aa79261da5e57340b4334f1ad8db2b9b761b3187d6b7f5e","observation_id":"d55281f1-d88e-46cc-a9fb-13cecc4bdc98","resolution":{"observed_at":"2026-08-10T15:56:37.656464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T14:43:38.979512Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15073","last_updated":"2025-01-25T04:43:12Z","snapshot_observed_at":"2026-08-10T14:36:34.334096Z","submitted_at":"2025-01-25T04:43:12Z","title":"SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled Videos","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T14:43:38.979512Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.15073"},"observation_digest":"sha256:f09c0ce7d66ae71434ae12fb386b589e180f37a41113e56ae3f7f31f48b17c01","observation_id":"3dc38dd8-50f9-41c9-8692-9e850f9b14ca","resolution":{"observed_at":"2026-08-10T14:43:38.979512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-10T13:53:27.070979Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.15953","last_updated":"2025-01-27T10:57:24Z","snapshot_observed_at":"2026-08-11T22:01:48.811389Z","submitted_at":"2025-01-27T10:57:24Z","title":"Understanding Long Videos via LLM-Powered Entity Relation Graphs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T13:53:27.070979Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.15953"},"observation_digest":"sha256:5c3edef7f42bff3db657f8da19d9800c47819c8203246244c133c5ad5679b596","observation_id":"6ead0cae-eefb-4090-bfb7-abaf41a42baa","resolution":{"observed_at":"2026-08-10T13:53:27.070979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-09T21:37:01.129396Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.19034","last_updated":"2025-07-16T04:20:58Z","snapshot_observed_at":"2026-08-10T03:48:35.176225Z","submitted_at":"2025-01-31T11:03:54Z","title":"XRF V2: A Dataset for Action Summarization with Wi-Fi Signals, and IMUs in Phones, Watches, Earbuds, and Glasses","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-09T21:37:01.129396Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2501.19034"},"observation_digest":"sha256:ce95856f11e801ef26c88b6e76a2eb56acabc98eab676546e184811ce65651cc","observation_id":"9e1eaf42-8b49-4753-b98c-53e90cf689e3","resolution":{"observed_at":"2026-08-09T21:37:01.129396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-09T10:51:29.201639Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02885","last_updated":"2025-04-08T15:45:28Z","snapshot_observed_at":"2026-08-10T08:12:38.043639Z","submitted_at":"2025-02-05T04:51:46Z","title":"Expertized Caption Auto-Enhancement for Video-Text Retrieval","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T10:51:29.201639Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2502.02885"},"observation_digest":"sha256:2b298306ea588707ea642d5ec87e867b573288adf575803500e320c52d06fa7a","observation_id":"18a5d58a-d8dc-486a-bcbf-96dcf678f6e4","resolution":{"observed_at":"2026-08-09T10:51:29.201639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-08T20:06:35.190284Z","title":"Wang, Y ., Wang, Y ., Zhao, D., Xie, C., and Zheng, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05173","last_updated":"2025-05-30T03:54:16Z","snapshot_observed_at":"2026-08-09T16:45:21.957564Z","submitted_at":"2025-02-07T18:56:04Z","title":"VideoRoPE: What Makes for Good Video Rotary Position Embedding?","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T20:06:35.190284Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2502.05173"},"observation_digest":"sha256:13a655fb4d8d700efcca5af361a6efeecf093f974441236419efd6ed56836f92","observation_id":"dc9bac64-023a-4caa-b918-1bec63136a6a","resolution":{"observed_at":"2026-08-08T20:06:35.190284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-08T13:12:05.071047Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.07327","last_updated":"2025-07-29T03:43:44Z","snapshot_observed_at":"2026-08-11T09:10:41.651542Z","submitted_at":"2025-02-11T07:43:47Z","title":"Generative Ghost: Investigating Ranking Bias Hidden in AI-Generated Videos","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T13:12:05.071047Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2502.07327"},"observation_digest":"sha256:0855e5e0a75f32192a642426bcf63f44264773d57a87e154aed139ed9114000c","observation_id":"6d980b77-377e-436e-b647-a44a6c4e628a","resolution":{"observed_at":"2026-08-08T13:12:05.071047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T15:02:29.260811Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16594","last_updated":"2025-05-22T12:28:50Z","snapshot_observed_at":"2026-08-10T08:12:47.722803Z","submitted_at":"2025-05-22T12:28:50Z","title":"Temporal Object Captioning for Street Scene Videos from LiDAR Tracks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:29.260811Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.16594"},"observation_digest":"sha256:4545c58beb6f6791f20a05145fc5a133d615faae7f703d81282c5d53731a3e0d","observation_id":"aa1a084a-51b0-4e57-94fe-f26759cc1cfd","resolution":{"observed_at":"2026-08-07T15:02:29.260811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T14:14:45.013607Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-09T09:30:25.697403Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.013607Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d1392c381a3fb20c0380d4aa707487913ac029a4a0b9cb518e16d07719e6e614","observation_id":"c92fe79b-13d1-4bc5-a59a-c97df7637a2d","resolution":{"observed_at":"2026-08-07T14:14:45.013607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T13:48:15.328435Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20920","last_updated":"2025-05-27T09:10:59Z","snapshot_observed_at":"2026-08-12T03:01:37.630324Z","submitted_at":"2025-05-27T09:10:59Z","title":"HuMoCon: Concept Discovery for Human Motion Understanding","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:48:15.328435Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.20920"},"observation_digest":"sha256:c4f22bb4b392e89a31b6451362b35f7118e2237afdf610569b5a683d80a866c8","observation_id":"8401b309-0b16-4b9d-ac1b-30f5586f3016","resolution":{"observed_at":"2026-08-07T13:48:15.328435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T12:30:33.191576Z","title":"InternVideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24371","last_updated":"2025-07-28T02:22:21Z","snapshot_observed_at":"2026-08-10T08:13:09.334545Z","submitted_at":"2025-05-30T09:04:30Z","title":"Grid-LOGAT: Grid Based Local and Global Area Transcription for Video Question Answering","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:33.191576Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.24371"},"observation_digest":"sha256:46d9878fc2c69a321d16a55d0300375470a57a07922c071ac3a39042d2b7c1f3","observation_id":"a19f1bcc-2c7e-4e11-9527-3b1c0426aa55","resolution":{"observed_at":"2026-08-07T12:30:33.191576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T11:59:06.099409Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00827","last_updated":"2025-06-01T04:22:02Z","snapshot_observed_at":"2026-08-10T08:13:07.260920Z","submitted_at":"2025-06-01T04:22:02Z","title":"Improving Keystep Recognition in Ego-Video via Dexterous Focus","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:06.099409Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.00827"},"observation_digest":"sha256:45ea00454ca89ed762974a54ab44e1017cde8d98283dfdf9f98ad5fff671c52c","observation_id":"348e432f-cd03-416b-8af0-23bf91de4165","resolution":{"observed_at":"2026-08-07T11:59:06.099409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T11:22:59.564896Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02692","last_updated":"2025-06-03T09:42:54Z","snapshot_observed_at":"2026-08-09T11:48:18.434737Z","submitted_at":"2025-06-03T09:42:54Z","title":"Large-scale Self-supervised Video Foundation Model for Intelligent Surgery","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:22:59.564896Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.02692"},"observation_digest":"sha256:69d4466436cd4fd92a566a1993d43675faf6bdc2d0decdeb94af4f3050ccc87c","observation_id":"00fe6806-3f7c-4d4b-9759-d075e8f50405","resolution":{"observed_at":"2026-08-07T11:22:59.564896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T10:27:05.495697Z","title":"Internvideo: General video foundation models via generative and discriminative learning.CoRR, abs/2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-08T19:39:48.959316Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.495697Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:da78d4a5be18228ab929466aa9a6d38755041e55164966e95edee3bb27763943","observation_id":"0ba4e3ee-4df0-48c8-b7f6-ca213a40175a","resolution":{"observed_at":"2026-08-07T10:27:05.495697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T05:31:42.620432Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07886","last_updated":"2025-07-19T15:33:13Z","snapshot_observed_at":"2026-08-10T08:12:33.197302Z","submitted_at":"2025-06-09T15:59:25Z","title":"EgoM2P: Egocentric Multimodal Multitask Pretraining","version":3},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-08-07T05:31:42.620432Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.07886"},"observation_digest":"sha256:ccbb8422b945983800073015fd3546c6311b27a8daeffba0c7b3a833bb21d92a","observation_id":"e067d0b9-cc70-41ab-840e-dcdd53d4e93d","resolution":{"observed_at":"2026-08-07T05:31:42.620432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T05:04:38.612750Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08887","last_updated":"2025-06-10T15:16:40Z","snapshot_observed_at":"2026-08-10T20:07:39.490837Z","submitted_at":"2025-06-10T15:16:40Z","title":"DiscoVLA: Discrepancy Reduction in Vision, Language, and Alignment for Parameter-Efficient Video-Text Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:38.612750Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.08887"},"observation_digest":"sha256:b58b029e3fc14d95f0c1863b0e1bd1f240d9d7e944ee81f72dbe7b5c4f9cdefd","observation_id":"300d6d22-2ed4-4a14-89bc-5e3f9fe69607","resolution":{"observed_at":"2026-08-07T05:04:38.612750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T04:44:02.280523Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09954","last_updated":"2025-06-11T17:23:41Z","snapshot_observed_at":"2026-08-07T21:45:10.885875Z","submitted_at":"2025-06-11T17:23:41Z","title":"Vision Generalist Model: A Survey","version":1},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:02.280523Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.09954"},"observation_digest":"sha256:97575e39eb589a27696843338ba25e2cdb4c35c70d39fbad9c9b41fb34c01095","observation_id":"1afc1f04-1945-446e-8181-a52b3e8865f1","resolution":{"observed_at":"2026-08-07T04:44:02.280523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:33:19.311995Z","title":"Internvideo: General video foundation models via generative and discriminative learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-10T10:57:00.100394Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.311995Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:ed9ff4a136875cdb0ad17ec75b6e410c84cd71cc4fe29fe3661cb4d689fe862e","observation_id":"90ff68e9-ab1c-4fff-90a3-784606db2304","resolution":{"observed_at":"2026-08-07T00:33:19.311995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T00:25:59.990074Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.14356","last_updated":"2025-06-17T09:51:51Z","snapshot_observed_at":"2026-08-09T16:46:35.710854Z","submitted_at":"2025-06-17T09:51:51Z","title":"EVA02-AT: Egocentric Video-Language Understanding with Spatial-Temporal Rotary Positional Embeddings and Symmetric Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:25:59.990074Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.14356"},"observation_digest":"sha256:97b5d90898e11f19d94442cfd05f983ebe6e2ed665978debcd5d3776811918f2","observation_id":"c5d6b164-6f58-4f03-a66e-b3565b0bde8d","resolution":{"observed_at":"2026-08-07T00:25:59.990074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T22:37:39.015632Z","title":"Internvideo: General video founda- tion models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21116","last_updated":"2025-07-08T02:46:17Z","snapshot_observed_at":"2026-08-06T22:30:40.624519Z","submitted_at":"2025-06-26T09:30:57Z","title":"IPFormer-VideoLLM: Enhancing Multi-modal Video Understanding for Multi-shot Scenes","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:37:39.015632Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.21116"},"observation_digest":"sha256:e9ee09be1632116bb34894a5cf8bd0c85abb75f9b4a3ecd19d2c22828c24840f","observation_id":"b084f60e-1e9e-47d1-943f-88b0537bc24e","resolution":{"observed_at":"2026-08-06T22:37:39.015632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T22:20:13.123695Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21891","last_updated":"2025-06-27T04:05:12Z","snapshot_observed_at":"2026-08-10T08:13:06.722091Z","submitted_at":"2025-06-27T04:05:12Z","title":"DIVE: Deep-search Iterative Video Exploration A Technical Report for the CVRR Challenge at CVPR 2025","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:20:13.123695Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.21891"},"observation_digest":"sha256:36b35e7dffa3705f4e9596ad228d49043de3e4bc1d1f12be3338ce1a06d718ec","observation_id":"a2fe6278-5c86-4b72-9064-55b7470acee5","resolution":{"observed_at":"2026-08-06T22:20:13.123695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T22:00:07.336150Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00068","last_updated":"2025-06-28T12:12:06Z","snapshot_observed_at":"2026-08-09T10:41:05.778908Z","submitted_at":"2025-06-28T12:12:06Z","title":"MANTA: Cross-Modal Semantic Alignment and Information-Theoretic Optimization for Long-form Multimodal Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:00:07.336150Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.00068"},"observation_digest":"sha256:5c73e1fe3a672c3df7c825a97c6dffcc41d7ce1989d339fb9f17694e3d281ac2","observation_id":"6f5abedc-1bfa-448b-bbb9-58b7c223be50","resolution":{"observed_at":"2026-08-06T22:00:07.336150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T20:15:10.801532Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03578","last_updated":"2025-07-04T13:48:12Z","snapshot_observed_at":"2026-08-07T05:28:01.157841Z","submitted_at":"2025-07-04T13:48:12Z","title":"SciVid: Cross-Domain Evaluation of Video Models in Scientific Applications","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:10.801532Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.03578"},"observation_digest":"sha256:e71b3a887110e69155741b2ce63e78c16c901bd5bdc065c641b0d13c92daafb2","observation_id":"8bfbe9db-ce8c-43be-b186-adac9a3252d1","resolution":{"observed_at":"2026-08-06T20:15:10.801532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:47:52.732569Z","title":"arXiv:2212.03191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04702","last_updated":"2025-07-07T06:51:40Z","snapshot_observed_at":"2026-08-11T03:57:37.664844Z","submitted_at":"2025-07-07T06:51:40Z","title":"Tempo-R0: A Video-MLLM for Temporal Video Grounding through Efficient Temporal Sensing Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:52.732569Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.04702"},"observation_digest":"sha256:fbe3c017a1c45ef274300690cf82cec15af627236880ae7bcfb11922c5e07c41","observation_id":"b9429fee-09fc-47cf-8c99-f2f74abd21c6","resolution":{"observed_at":"2026-08-06T19:47:52.732569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:39:51.612774Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05173","last_updated":"2025-07-07T16:25:47Z","snapshot_observed_at":"2026-08-10T05:03:32.372350Z","submitted_at":"2025-07-07T16:25:47Z","title":"Semantic Frame Interpolation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:39:51.612774Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.05173"},"observation_digest":"sha256:0f5c14415e1757c33150902056d934c64daec834d15ee596049bf85f84dcbea1","observation_id":"0aefedc9-f462-4c9a-b3b2-8c3d5401cc01","resolution":{"observed_at":"2026-08-06T19:39:51.612774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T18:40:04.192757Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07744","last_updated":"2025-07-10T13:23:41Z","snapshot_observed_at":"2026-08-07T04:04:03.440937Z","submitted_at":"2025-07-10T13:23:41Z","title":"Sparse-Dense Side-Tuner for efficient Video Temporal Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:40:04.192757Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.07744"},"observation_digest":"sha256:f60096398ff55f68f88595681f0ff1cf31a09211bbde2ab5c5bb4bb7c4b2d1f8","observation_id":"dae05960-f941-4840-985e-c37e44273954","resolution":{"observed_at":"2026-08-06T18:40:04.192757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:50:22.840001Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-09T15:11:32.122204Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.840001Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e7f5ebfee2a6614f4735b2de6e1582f1376373e8de2dac06e98f12b39ec25e73","observation_id":"90af2435-5042-4201-ad4c-2e1abd6c5506","resolution":{"observed_at":"2026-08-06T19:50:22.840001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T15:53:33.985536Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14784","last_updated":"2025-08-18T09:06:46Z","snapshot_observed_at":"2026-08-09T23:46:47.099823Z","submitted_at":"2025-07-20T01:57:00Z","title":"LeAdQA: LLM-Driven Context-Aware Temporal Grounding for Video Question Answering","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:33.985536Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.14784"},"observation_digest":"sha256:6e6568a0efeebd305f3d2cfea7554dc207eabf2900cd7066719c274433bed716","observation_id":"970d892b-4ebf-4a2c-857f-c384ef6afc3b","resolution":{"observed_at":"2026-08-06T15:53:33.985536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T15:30:20.026745Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15628","last_updated":"2025-07-21T13:52:06Z","snapshot_observed_at":"2026-08-10T17:33:12.263927Z","submitted_at":"2025-07-21T13:52:06Z","title":"A Survey on Efficiency Optimization Techniques for DNN-based Video Analytics: Process Systems, Algorithms, and Applications","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-06T15:30:20.026745Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.15628"},"observation_digest":"sha256:6e61684baee8adf21621e28a0076c7afde5dc61086a8e922af6ff1536122618a","observation_id":"f72bac2e-7def-4f46-a900-25c955dfb1f9","resolution":{"observed_at":"2026-08-06T15:30:20.026745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T14:36:17.726835Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18552","last_updated":"2025-07-24T16:19:43Z","snapshot_observed_at":"2026-08-10T08:12:14.836020Z","submitted_at":"2025-07-24T16:19:43Z","title":"VideoMind: An Omni-Modal Video Dataset with Intent Grounding for Deep-Cognitive Video Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:17.726835Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.18552"},"observation_digest":"sha256:e8c6dce1186c2981f66b0c393e23954fdf5a7b4894282a32a485a08142290262","observation_id":"2228c1a3-fef8-4a05-9d27-bde4302af7f0","resolution":{"observed_at":"2026-08-06T14:36:17.726835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T14:19:37.661534Z","title":"Internvideo: General video foundation models via generative and discrim- inative learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19599","last_updated":"2025-07-25T18:11:23Z","snapshot_observed_at":"2026-08-07T08:25:24.125935Z","submitted_at":"2025-07-25T18:11:23Z","title":"Object-centric Video Question Answering with Visual Grounding and Referring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T14:19:37.661534Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.19599"},"observation_digest":"sha256:1a26e861ea6d0d622a12a03a47859503b1309c5ea93a827a2ddeff6f2487a892","observation_id":"6a9aaa68-a589-4f06-9676-baa83d4ef10e","resolution":{"observed_at":"2026-08-06T14:19:37.661534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T10:17:37.471841Z","title":"Internvideo: General video founda- tion models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00367","last_updated":"2025-08-01T06:53:55Z","snapshot_observed_at":"2026-08-10T08:12:31.901909Z","submitted_at":"2025-08-01T06:53:55Z","title":"Representation Shift: Unifying Token Compression with FlashAttention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:17:37.471841Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.00367"},"observation_digest":"sha256:ca1757ab74ee0a16b3bff84ea1dc2c1a1454a8f006c5df97027f2f4efd064379","observation_id":"af83d3d0-c08e-4df0-801c-d839ffb69237","resolution":{"observed_at":"2026-08-06T10:17:37.471841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T05:30:36.666749Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.01699","last_updated":"2025-08-03T10:03:58Z","snapshot_observed_at":"2026-08-09T05:23:23.804073Z","submitted_at":"2025-08-03T10:03:58Z","title":"TimeExpert: An Expert-Guided Video LLM for Video Temporal Grounding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:30:36.666749Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.01699"},"observation_digest":"sha256:c718c6b17313d8956f3dc5f08431e92c925a7c616da5b65759dd482a61707485","observation_id":"d3969c71-fd3e-4fd9-a942-9c16d6e17c84","resolution":{"observed_at":"2026-08-06T05:30:36.666749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T04:49:41.380659Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.03039","last_updated":"2025-08-05T03:33:24Z","snapshot_observed_at":"2026-08-07T14:34:47.687957Z","submitted_at":"2025-08-05T03:33:24Z","title":"VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T04:49:41.380659Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.03039"},"observation_digest":"sha256:94b498422c64c0ff56736b48491d8172a65e7082a6e088a07cb9395a6a95ab59","observation_id":"cdb02b9b-67d9-4830-be24-be0b0b3b54f8","resolution":{"observed_at":"2026-08-06T04:49:41.380659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T23:32:17.441242Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.441242Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:895ae8cd2b160610184a0fb1680264439436a0afb48fc4bd73c746f949d1ae61","observation_id":"b6867581-5b02-4758-9364-ed0c7a825638","resolution":{"observed_at":"2026-08-05T23:32:17.441242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T13:46:01.537622Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00357","last_updated":"2025-08-30T04:36:41Z","snapshot_observed_at":"2026-08-09T06:09:58.396638Z","submitted_at":"2025-08-30T04:36:41Z","title":"SurgLLM: A Versatile Large Multimodal Model with Spatial Focus and Temporal Awareness for Surgical Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:46:01.537622Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2509.00357"},"observation_digest":"sha256:87c581d755076a5ec92ac77f64137626b7135add32928e6fc3aade2238c36a4b","observation_id":"42adbfc4-cee6-4148-924c-fb69c2c67615","resolution":{"observed_at":"2026-08-05T13:46:01.537622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T19:37:41.645943Z","title":"Internvideo: General video foundation models via gen- erative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09151","last_updated":"2026-06-08T07:16:30Z","snapshot_observed_at":"2026-08-09T17:50:11.271087Z","submitted_at":"2025-09-11T05:06:30Z","title":"Video Understanding by Design: How Datasets Shape Video Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:41.645943Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2509.09151"},"observation_digest":"sha256:a36a819de9f96cc99a5420e278946434eee10009e66db378a8a8d19bdc048cd2","observation_id":"a0fc6081-e0ab-4d7b-aab9-69f4f9ca65f5","resolution":{"observed_at":"2026-08-04T19:37:41.645943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T13:27:57.880798Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image percep- tion in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.00705","last_updated":"2026-06-26T15:22:20Z","snapshot_observed_at":"2026-08-10T21:44:39.000633Z","submitted_at":"2025-10-01T09:20:51Z","title":"Training-free Uncertainty Guidance for Complex Visual Tasks with MLLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T13:27:57.880798Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2510.00705"},"observation_digest":"sha256:2a75b6f64d803a368c95693f2988f7ead93e91d121d12d00817c1e14ffa70693","observation_id":"83e97f27-3ede-4322-9404-30dabd8d60ff","resolution":{"observed_at":"2026-08-04T13:27:57.880798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-04T13:22:35.256568Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.01009","last_updated":"2026-03-30T19:53:43Z","snapshot_observed_at":"2026-08-08T10:23:12.383888Z","submitted_at":"2025-10-01T15:15:36Z","title":"POVQA: Preference-Optimized Video Question Answering with Rationales for Data Efficiency","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T13:22:35.256568Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2510.01009"},"observation_digest":"sha256:96f8930c29c5af359e3ef60c3bc333b4c05ae1b7e27177db0997dc75d83ef8bf","observation_id":"4cab872b-e3ab-488b-b404-c942bc03d25f","resolution":{"observed_at":"2026-08-04T13:22:35.256568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2511.08666","last_updated":"2026-04-02T21:41:06Z","snapshot_observed_at":"2026-08-07T14:12:34.472748Z","submitted_at":"2025-11-11T18:56:27Z","title":"Privacy Beyond Pixels: Latent Anonymization for Privacy-Preserving Video Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T23:12:48.977906Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2511.08666"},"observation_digest":"sha256:68071a5e7a1ef28d0cca5a7bbf07efc4e3c0f6c715eb2ff9204ece5cde580069","observation_id":"24f8e7fc-8aca-4f6f-b9a0-9fe7d3c6f1cb","resolution":{"observed_at":"2026-05-17T23:15:26.841249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2511.12034","last_updated":"2026-05-12T07:28:48Z","snapshot_observed_at":"2026-08-02T17:34:14.031307Z","submitted_at":"2025-11-15T05:01:43Z","title":"Calibrated Multimodal Representation Learning with Missing Modalities","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T22:08:07.217659Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2511.12034"},"observation_digest":"sha256:ec5528c64fcdaed7e76b057e5ae6d0577782bf6695a32702f7d82ef2d9d1fdb8","observation_id":"54858588-607d-4546-a315-28a6f8808edb","resolution":{"observed_at":"2026-05-17T22:10:22.648940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-03T18:49:01.911861Z","title":"Internvideo: Gen- eral video foundation models via generative and discrimina- tive learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.03627","last_updated":"2026-06-02T03:13:58Z","snapshot_observed_at":"2026-08-03T18:48:56.892789Z","submitted_at":"2025-12-03T10:06:14Z","title":"MemVerse: Multimodal Memory for Lifelong Learning Agents","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:49:01.911861Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2512.03627"},"observation_digest":"sha256:d1ef824be25b372b509561cca9669a8a4945e8ed0b46df41be0e052f8e93fb82","observation_id":"0bd9ef4e-cd8a-4dfd-8f4b-c25aa71efffe","resolution":{"observed_at":"2026-08-03T18:49:01.911861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2512.03963","last_updated":"2026-04-14T11:28:58Z","snapshot_observed_at":"2026-08-11T03:45:42.619022Z","submitted_at":"2025-12-03T16:57:00Z","title":"TempR1: Improving Temporal Understanding of MLLMs via Temporal-Aware Multi-Task Reinforcement Learning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T02:18:21.718091Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2512.03963"},"observation_digest":"sha256:7f291d1e32a99367b364db6fc0dd74259b6ea916c6d63caf669ae0e326d32b88","observation_id":"a8c5d2f2-9c0e-49b3-b0e0-b42e0379d4fd","resolution":{"observed_at":"2026-05-17T02:18:52.306944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2512.21334","last_updated":"2026-04-10T15:00:46Z","snapshot_observed_at":"2026-08-11T12:25:07.868269Z","submitted_at":"2025-12-24T18:59:36Z","title":"Streaming Video Instruction Tuning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T19:44:11.032898Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2512.21334"},"observation_digest":"sha256:e147a9d92c97697b0394602947e7eebe3ed899ddd4bb3c90492e8e08968da1af","observation_id":"37572fa0-5626-4f10-9f5a-258f3dde406e","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.02860","last_updated":"2026-04-03T08:26:12Z","snapshot_observed_at":"2026-08-11T13:13:07.327843Z","submitted_at":"2026-04-03T08:26:12Z","title":"A Paradigm Shift: Fully End-to-End Training for Temporal Sentence Grounding in Videos","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:57.298338Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.02860"},"observation_digest":"sha256:4107339d047be35d611e569370d462704ac7feb44d973ec4886d6759ea0e5538","observation_id":"bfaab06c-71e3-421d-9609-00e72cfd5b0b","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.08522","last_updated":"2026-04-09T17:57:09Z","snapshot_observed_at":"2026-08-11T02:06:45.288553Z","submitted_at":"2026-04-09T17:57:09Z","title":"UniversalVTG: A Universal and Lightweight Foundation Model for Video Temporal Grounding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T17:55:56.385801Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.08522"},"observation_digest":"sha256:9955415c030d5cdead15f49248668065b9448253ba0a6b953968468f61e72751","observation_id":"cb0ed3f3-8518-488b-8bc7-54393e26bd03","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.08762","last_updated":"2026-04-09T20:51:13Z","snapshot_observed_at":"2026-07-06T22:57:50.266735Z","submitted_at":"2026-04-09T20:51:13Z","title":"InstrAct: Towards Action-Centric Understanding in Instructional Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:07:49.334104Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.08762"},"observation_digest":"sha256:d0bfdba53e2574d92fc7fa5f929806d0bc9c7069e2e2cfc224294adcc3ce9595","observation_id":"2f3da1ce-7e24-4264-83c9-dc24e3758d6c","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.09164","last_updated":"2026-04-10T09:51:15Z","snapshot_observed_at":"2026-08-02T06:26:16.902313Z","submitted_at":"2026-04-10T09:51:15Z","title":"Efficient Spatial-Temporal Focal Adapter with SSM for Temporal Action Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T17:31:28.091617Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.09164"},"observation_digest":"sha256:abab6592b7aea4352a980f5f6a1e65b2c4e670fd7b80df262a43766fef01004b","observation_id":"5e9056e4-6d5b-4ad1-a422-e1c4b943801b","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Internvideo: General video foundation models via generative and discriminative learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:84a9ee8ab8339be8e66f6f567f6b280e56c77150ce26bfe60a8e2c77efbf749f","observation_id":"80c999f0-f809-4892-80c9-05670df423ee","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.11913","last_updated":"2026-04-13T18:04:58Z","snapshot_observed_at":"2026-08-11T04:45:49.206295Z","submitted_at":"2026-04-13T18:04:58Z","title":"V-Nutri: Dish-Level Nutrition Estimation from Egocentric Cooking Videos","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T15:00:21.173667Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.11913"},"observation_digest":"sha256:d28cbc7202ddc961d6e6223c24255c0b0c7b43708e9e251a063e2740e47252d3","observation_id":"4c3bf265-d301-486d-a0dd-5db372730b9f","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.14074","last_updated":"2026-04-15T16:44:57Z","snapshot_observed_at":"2026-08-09T05:08:29.710872Z","submitted_at":"2026-04-15T16:44:57Z","title":"Training-Free Semantic Multi-Object Tracking with Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T14:12:08.080882Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.14074"},"observation_digest":"sha256:c1c3ba04386109dd405a0d4f95f48f324fb4f11ac0e62e355acb1fc3ba156149","observation_id":"5abab684-03bd-4f0f-94bf-1dca71245f25","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-08-11T17:29:29.888451Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:f7d98bf4f37a53df1f5d1a1e60acb44f759c23bb4c74204432fa555fbff0c8e1","observation_id":"9b6d375d-c00b-435d-a506-c1877d4b37fa","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.22808","last_updated":"2026-04-14T08:29:10Z","snapshot_observed_at":"2026-07-06T23:09:10.050398Z","submitted_at":"2026-04-14T08:29:10Z","title":"FreqFormer: Hierarchical Frequency-Domain Attention with Adaptive Spectral Routing for Long-Sequence Video Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:54:34.742037Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.22808"},"observation_digest":"sha256:c7a13d2b2677e69f1bc3427241d0316f2a725879c88b19f58d42c5caf5802cd8","observation_id":"d83e73e6-b449-424e-a5af-6322efd980fc","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2604.27975","last_updated":"2026-08-04T03:44:13Z","snapshot_observed_at":"2026-08-07T23:09:25.053410Z","submitted_at":"2026-04-30T15:05:06Z","title":"TransVLM: A Vision-Language Framework and Benchmark for Detecting Any Shot Transitions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T07:23:19.988849Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2604.27975"},"observation_digest":"sha256:48e33f3ab8c0787de0055b7f8519803af6659e7015b3f590d2975c51d9590e27","observation_id":"87782323-821d-4a64-9cac-a087cc63c553","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.05187","last_updated":"2026-05-06T17:52:39Z","snapshot_observed_at":"2026-08-11T06:58:22.268225Z","submitted_at":"2026-05-06T17:52:39Z","title":"LoViF 2026 The First Challenge on Holistic Quality Assessment for 4D World Model (PhyScore)","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-08T16:20:40.024442Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.05187"},"observation_digest":"sha256:58d980f35959a5ebfcc50667123289f6c1044ecee8a68b5bf26dd2ee625c9679","observation_id":"6bcde318-897e-4397-a625-9d49d956b91c","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-08-11T23:11:29.035235Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:21464754a4e4a3c4f7a58ed83242253451d630b127a7434f1b43be9fd22fde0a","observation_id":"12b3b07f-e37d-4890-a123-a673735728e3","resolution":{"observed_at":"2026-05-17T00:36:53.574468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.27894","last_updated":"2026-05-27T03:18:10Z","snapshot_observed_at":"2026-08-03T02:45:48.219653Z","submitted_at":"2026-05-27T03:18:10Z","title":"Towards Unified Vision-Language Models with Incomplete Multi-Modal Inputs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:39:55.838296Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.27894"},"observation_digest":"sha256:8d0b23330e462c711ff43cb5612dac1d8968c394ddd6bd7782d9faa512777945","observation_id":"540ed8ae-eb16-47ec-84c2-4491799d41fd","resolution":{"observed_at":"2026-06-29T13:43:28.717924Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.29858","last_updated":"2026-05-28T12:39:04Z","snapshot_observed_at":"2026-08-01T18:17:02.617293Z","submitted_at":"2026-05-28T12:39:04Z","title":"Masked Diffusion Vision-Language Models for Temporal Action Localization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T07:56:52.524815Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.29858"},"observation_digest":"sha256:0167efab176da30dd4de05178e8e02f8871cbac64fb153bf25304b7ec9e2ffc6","observation_id":"548a9304-72f2-43f2-a259-ec377032e5c8","resolution":{"observed_at":"2026-06-29T08:03:13.675969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2605.31033","last_updated":"2026-05-29T09:04:26Z","snapshot_observed_at":"2026-08-08T12:44:51.980634Z","submitted_at":"2026-05-29T09:04:26Z","title":"SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:44:14.089224Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2605.31033"},"observation_digest":"sha256:b742072ed48e98ff8a842d5d8414650716982552c690667a18e8e417fe889ed0","observation_id":"c32974c2-d111-475b-8892-da0514548ff6","resolution":{"observed_at":"2026-07-01T19:25:59.915450Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.01615","last_updated":"2026-06-01T03:02:35Z","snapshot_observed_at":"2026-08-03T10:30:12.818798Z","submitted_at":"2026-06-01T03:02:35Z","title":"Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T15:44:59.586877Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.01615"},"observation_digest":"sha256:a19cfaae237df41819529d8c8261bc5244832460c366cb11556726fad87b8de5","observation_id":"15d7c3b1-9c1e-4b97-8b57-739a3057391c","resolution":{"observed_at":"2026-07-01T22:06:16.675454Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.02962","last_updated":"2026-06-01T23:46:18Z","snapshot_observed_at":"2026-08-02T17:34:33.446374Z","submitted_at":"2026-06-01T23:46:18Z","title":"Hand Trajectory Fusion for Egocentric Natural Language Query Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T14:35:59.044093Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.02962"},"observation_digest":"sha256:e5888602fb904be617437150ee40a74b6d11736db2c10ea3ee328afe18864617","observation_id":"3bb252a5-28db-4320-8be4-cd59e35bf2ed","resolution":{"observed_at":"2026-07-01T23:16:23.361936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.03837","last_updated":"2026-06-02T16:19:58Z","snapshot_observed_at":"2026-08-07T15:57:40.990806Z","submitted_at":"2026-06-02T16:19:58Z","title":"Where Do We (Not) Need Temporal Context in Low-Resource Video Task Adaptation?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T10:31:10.409674Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.03837"},"observation_digest":"sha256:ee7f45164ebfd4e241fdeb0d19bea9db825e9b7611641cc08d93e3f44443a345","observation_id":"02c8d935-0e67-4f5c-bb43-a3de99cb64fd","resolution":{"observed_at":"2026-07-02T02:56:28.973260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.06991","last_updated":"2026-06-05T07:29:20Z","snapshot_observed_at":"2026-08-10T11:26:35.969932Z","submitted_at":"2026-06-05T07:29:20Z","title":"Don't Pause: Streaming Video-Language Synchrony for Online Video Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T22:11:01.690237Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.06991"},"observation_digest":"sha256:96bd0f5a0abd15f0cb55c75d348826380d254259203fe63f40755b79b65e7b03","observation_id":"783c631f-84aa-4d63-91a5-94c250fdfd21","resolution":{"observed_at":"2026-07-02T17:07:12.866731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.09156","last_updated":"2026-06-08T07:47:53Z","snapshot_observed_at":"2026-08-12T01:47:34.947251Z","submitted_at":"2026-06-08T07:47:53Z","title":"OmniGen-AR: AutoRegressive Any-to-Image Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T17:05:16.883488Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.09156"},"observation_digest":"sha256:99c3e75946df21918a18a2ed4e458ac136d0397ebf016a0e6dfd337664d83501","observation_id":"80ea8512-3fdd-4a73-a8a0-9b80926e8809","resolution":{"observed_at":"2026-07-03T00:47:29.719943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.09393","last_updated":"2026-06-08T12:09:20Z","snapshot_observed_at":"2026-08-07T21:51:25.793927Z","submitted_at":"2026-06-08T12:09:20Z","title":"CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T17:21:38.543724Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.09393"},"observation_digest":"sha256:73d3ed2d6470f926551e7e784fdce3392d10362a153086761c4ea0eae0e7e82b","observation_id":"819f3b21-28cb-44ed-80f0-95472100bc9e","resolution":{"observed_at":"2026-07-03T00:17:29.029387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:ff0789b624d39cd229955537b9ac1bcffa5f908b5827ac2521c2855fae886979","observation_id":"0370a05a-f20c-4ca0-81a3-e3dabcc01d6a","resolution":{"observed_at":"2026-07-03T10:48:03.081920Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.13289","last_updated":"2026-06-11T12:46:07Z","snapshot_observed_at":"2026-08-02T10:42:01.559662Z","submitted_at":"2026-06-11T12:46:07Z","title":"HYDRA-X: Native Unified Multimodal Models with Holistic Visual Tokenizers","version":1},"reference_index":259,"source":"arxiv_source","source_observed_at":"2026-06-27T07:01:07.362430Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.13289"},"observation_digest":"sha256:e0ab8deed24df7382f63d290e52ecc63ab5f82bfdf2fb30ff9a9dceb9f3f6456","observation_id":"c65d055d-8457-4dd4-ad6e-f5aea84e5f40","resolution":{"observed_at":"2026-07-03T14:28:32.148227Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.13768","last_updated":"2026-06-16T17:59:39Z","snapshot_observed_at":"2026-08-06T01:41:21.935867Z","submitted_at":"2026-06-11T17:59:10Z","title":"CineOrchestra: Unified Entity-Centric Conditioning for Cinematic Video Generation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T06:51:31.625416Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.13768"},"observation_digest":"sha256:3c2600b24c2174a5790414f74f90eb0df252e70fb7f6c9cff2be7cde95aa699b","observation_id":"298abd9b-abef-4d23-bef4-ee332f59169d","resolution":{"observed_at":"2026-07-03T14:58:32.699908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.17798","last_updated":"2026-06-16T11:18:05Z","snapshot_observed_at":"2026-08-08T11:16:26.006355Z","submitted_at":"2026-06-16T11:18:05Z","title":"LiveStarPro: Proactive Streaming Video Understanding with Hierarchical Memory for Long-Horizon Streams","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T01:12:46.295455Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.17798"},"observation_digest":"sha256:d7bbb3b938a63522043552da8818dbfe8ca0389d338f21eca39188959c9021e8","observation_id":"896845f4-3d43-4c4e-b595-bd8a8b081d21","resolution":{"observed_at":"2026-07-03T20:38:56.183828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:4e197bee9307d1f8dba810165c88a72e1e94be0f043cf533a9768e2560029ccc","observation_id":"cbf220b3-9e5e-4017-9a65-c6385dd757a5","resolution":{"observed_at":"2026-07-04T05:49:36.553029Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.21607","last_updated":"2026-06-19T17:09:14Z","snapshot_observed_at":"2026-08-03T19:48:03.056531Z","submitted_at":"2026-06-19T17:09:14Z","title":"T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T14:44:41.975446Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.21607"},"observation_digest":"sha256:d8443a53b49e07aceabcd5043a526a38ab3d15da085fc18f5e911ad8468e7b03","observation_id":"ba56b6ce-d30e-499e-a94c-ef4e93ca4736","resolution":{"observed_at":"2026-07-04T06:09:37.770438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-11T09:58:16.500600Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T00:29:41.291832Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:4a115e5605f7c697f384e6a4140caccbbf19cc5b5bd76a6d19809e5ad227a773","observation_id":"5144b89b-7a7f-47d7-a87e-287d799f017e","resolution":{"observed_at":"2026-07-04T16:29:57.892760Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.24253","last_updated":"2026-06-26T09:37:54Z","snapshot_observed_at":"2026-08-11T09:58:16.500600Z","submitted_at":"2026-06-23T07:42:22Z","title":"TuringViT: Making SOTA Vision Transformers Accessible to All","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:32:26.746776Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.24253"},"observation_digest":"sha256:05af20d35d3f4e1043b3fadf7906291f87d49bd017c1890d86b072bfc45355e9","observation_id":"51a988bd-d8ea-4162-a98f-522828bf77c1","resolution":{"observed_at":"2026-06-29T15:03:32.165860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.25160","last_updated":"2026-06-23T20:46:54Z","snapshot_observed_at":"2026-07-06T23:59:37.533078Z","submitted_at":"2026-06-23T20:46:54Z","title":"Toward Low-Latency Vision-Language Models with Doubly-Correct Predictions in Egocentric Visual Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-25T23:47:12.032082Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.25160"},"observation_digest":"sha256:0e945a111b6123d4d446774b79302b8c29cea03dfaecaf45c4b91d5fb2e34a1f","observation_id":"10770e63-f3c8-4620-824e-8f9dae2936e3","resolution":{"observed_at":"2026-07-04T17:20:00.467194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":"2212.03191","doi":"10.48550/arxiv.2212.03191","metadata_source":"pith","pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","venue":"cs.CV","work_id":"780aaeee-ac26-46b1-b6ff-64a7a624e694","year":2022},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:0c1a008e9b61bfff8b40c4124445e0b95544a6126976ea8d53eba2f4aca17af0","observation_id":"8e3dfb14-5527-4d05-8da4-b95867e89cb9","resolution":{"observed_at":"2026-06-30T07:54:22.348256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-07-14T14:53:56.693464Z","title":"arXiv preprint arXiv:2212.03191 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09876","last_updated":"2026-07-10T18:09:41Z","snapshot_observed_at":"2026-08-08T22:35:43.209590Z","submitted_at":"2026-07-10T18:09:41Z","title":"Prompting-MammAlps: Fine-Grained Text-to-Video Retrieval for Camera-Trap Data","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-14T14:53:56.693464Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2607.09876"},"observation_digest":"sha256:5b3619ca38e4b852187bc4e3a3efc55d0edd6aeee46baf83475938d4ee9d9394","observation_id":"6c80b62f-cce4-4116-aa83-1fa1c792e7a0","resolution":{"observed_at":"2026-07-14T14:53:56.693464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.03191/citation-record","integrity":"/paper/2212.03191/integrity","json":"/paper/2212.03191/citation-record.json","paper":"/paper/2212.03191"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nsnet: Non-saliency suppression sampler for efﬁcient video recognition","venue":null,"work_id":"1c3a412f-1be4-4220-9a0c-9f624633a9ee","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:9289f499d7abb9f3de760413bbac922befdddb2311d9cc035d1b65d818cecd51","observation_id":"3904b6a7-d161-4169-b3a8-96a507d5c664","resolution":{"observed_at":"2026-05-17T00:36:53.508727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to cycle: Time-consistent feature discovery for action recognition","venue":null,"work_id":"70df095d-478b-484f-9ccd-3fa37c253bf6","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:5eefa1d5ebdd285d867e8464f1fe5f6771577ae734aefda3138bac501e354557","observation_id":"cbffbc11-917c-4ad1-94dd-385cab12fc97","resolution":{"observed_at":"2026-05-17T00:36:53.514105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervising action recognition by statistical moment and subspace descriptors","venue":null,"work_id":"c73d4d95-4f62-4c5e-af1d-b96e81a8f764","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:390e4e8f484573f20ec19b3fec38bb6fe4083671da6fab5f8f3442f1c0e4bbef","observation_id":"dd35ef7d-c1ef-4b64-bb92-257903cfba94","resolution":{"observed_at":"2026-05-17T00:36:53.516789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actionformer: Localizing moments of actions with transformers","venue":null,"work_id":"cab6e9c5-d90c-4e5a-82dd-5cda04060341","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:85b09be5b7e0fb2e2e7e7d28eab440010ad684acc930388bd1a84261c2a5b751","observation_id":"4551cede-8f60-46b9-b39f-c6229ae96a31","resolution":{"observed_at":"2026-05-17T00:36:53.519516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Clip4clip: An empirical study of clip for end to end video clip retrieval and captioning","venue":null,"work_id":"239190df-6cd6-47e2-8f6d-63d10ff888fc","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:2b57f42b2e2a300ff6e591924c67ceb04b6b3edff5820f691b6b65540b7f546a","observation_id":"e626acfb-cab5-4f20-a700-3e5a8e8b8b37","resolution":{"observed_at":"2026-05-17T00:36:53.522177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked feature prediction for self-supervised visual pre-training","venue":null,"work_id":"27f340c8-f3ac-426a-baec-d6753d899c32","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:319c7200fdc4f892bd4e0a18e57f020c7ad751924386458368b562ffc22d6d0a","observation_id":"57446b8b-8a03-4a00-80e3-ad5434efd26c","resolution":{"observed_at":"2026-05-17T00:36:53.524483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:a0812de03ac1ec55a5b82b30e2ed01ed4601f53e5a91e0cac93e5c392e5abc77","observation_id":"041299c2-4743-4bdf-a2d4-5450b4b6993a","resolution":{"observed_at":"2026-05-17T00:36:53.357463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"7bc21f54-4295-4ada-9623-8866279e5911","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ac50418539ad3319aa4b02fb25e0b88f05d0821550d817d8d6a8bfefddcaab91","observation_id":"afaab448-fd03-4875-8d07-d6e643c521f0","resolution":{"observed_at":"2026-05-17T00:36:53.526483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlot: Multimodal neural script knowledge models","venue":null,"work_id":"5fa7e515-0078-4c49-966c-b93d367a6415","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:852f017c48f83fc2c544051a48b02a4f618b3b9cfd183be8638d28b77cf8d921","observation_id":"66281555-6776-43b3-9d94-1a1e57adb8a1","resolution":{"observed_at":"2026-05-17T00:36:53.528653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:14e087a0c598c6990be49041ca5c3aee389f6bbddc18de357ae5f43fc1f7b92a","observation_id":"ff7620d4-1be5-4c82-843f-88a18b392ccb","resolution":{"observed_at":"2026-05-17T00:36:53.354621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":"04ea8a74-bb8c-4650-bf6d-3d6fd1ee4e43","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6093be1da0559b9c205d477bda42202cff7d9d6db37b1c1fd04ac826228e0c40","observation_id":"72dfe7fc-0cf1-4782-9d65-7bbbd4f9d610","resolution":{"observed_at":"2026-05-17T00:36:53.530886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08687","last_updated":"2022-02-24T18:57:20Z","snapshot_observed_at":"2026-07-06T12:09:12.802530Z","submitted_at":"2021-11-16T18:42:50Z","title":"INTERN: A New Learning Paradigm Towards General Vision","version":2},"cited_work":{"arxiv_id":"2111.08687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.08687","snapshot_observed_at":"2026-07-03T23:49:02.370887Z","title":"Intern: A new learning paradigm towards general vision","venue":null,"work_id":"068d79cf-b161-4048-8073-7fc8e09fda58","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.08687","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:72612106d4ccfd672d95d5a21be3546ce54a1e33f35813d50a36e0e5a551c955","observation_id":"1df9fb52-dc1e-4933-bc0d-c08c2db0eec2","resolution":{"observed_at":"2026-05-17T00:36:53.329293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"9bffbdb8-c258-4baa-9649-552136632c24","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f9cbba43b16032fe31a650088b1bb9c8fd7b7af9b0621e2eb3f93e35eda9ca89","observation_id":"e4da4d3c-8d47-45b6-b5ff-48a6252475e3","resolution":{"observed_at":"2026-05-17T00:36:53.533740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"42a8bbc4-d140-4712-a8f5-075bbca7d884","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:d12833406afc74eae4e588a31604a28714081de2aec9d3145678cf62393aecf7","observation_id":"9b2314a5-8cee-4968-9d4b-1cc13321daf3","resolution":{"observed_at":"2026-05-17T00:36:53.536310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":"2111.11432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-07-04T20:00:08.247992Z","title":"Florence: A New Foundation Model for Computer Vision","venue":"cs.CV","work_id":"99823072-36a8-4b10-9ef5-a7f91da74650","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:053dcd622311cd30147aca01f0f0824aa40966d1cde2ff98a58ad28769ece153","observation_id":"109f2a8e-3b42-4a52-a230-15d8417d5650","resolution":{"observed_at":"2026-05-17T00:36:53.308902Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniﬁed contrastive learning in image-text-label space","venue":null,"work_id":"d009c12f-1ed1-4b5a-b6e9-b1a3fad52cd7","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:66fe1e972719a9bfa6bd9899a468ebd01a1365a28af27a7f495445582400f71c","observation_id":"4f1d64d9-2c27-4878-a18f-787c3dc6ce92","resolution":{"observed_at":"2026-05-17T00:36:53.538927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SimVLM: Simple visual language model pretraining with weak supervision","venue":null,"work_id":"ec283a6c-2de2-493e-ad3c-0bebf04ddc40","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:02b0912efce2a2ce84f7ee58d80f23a64110f1c4c42c9f60e1fe7fc47042f669","observation_id":"ba08958b-c143-46ad-8cf5-da2b9005a221","resolution":{"observed_at":"2026-05-17T00:36:53.541465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":null,"work_id":"962cfb84-e342-4e38-8580-9c798edb173d","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6d9d51f6a60b59fa08f8469542b3fb40c0e3a952c02f4610598437740ebb9b0e","observation_id":"a06c1fe5-9bea-4dad-a1f9-59470a7f62ec","resolution":{"observed_at":"2026-05-17T00:36:53.544680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-11T00:20:29.155513Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":"2208.10442","doi":"10.48550/arxiv.2208.10442","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ofa: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","venue":"arXiv (Cornell University)","work_id":"ddcdf64e-3f93-4e11-9dbf-1e71391c7dd7","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:cfd731253e9dc2cd0607189098715268f970930604ec3f3634f2661c61d86ed0","observation_id":"f2dbac5c-c1d7-41a8-9f03-5ea139503240","resolution":{"observed_at":"2026-05-17T00:36:53.366555Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:38:27.341793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:38:27.341793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BEit: BERT pre-training of image transformers","venue":null,"work_id":"387d4d5d-0a56-4b0f-a09f-6d16a238cc4a","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:39a6414091dd1e6437b7fbba43028efbca1a4e87f0bf8b8eb59a52f4a2e35ef1","observation_id":"398788ad-629b-4001-b807-112e6bf10745","resolution":{"observed_at":"2026-05-17T00:36:53.547292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pathways: Asynchronous distributed dataﬂow for ml","venue":null,"work_id":"46042212-07b9-47dd-aa6a-820f4c1685f4","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:0d25ddf5d56d2bf3352510b88b8fa36f13b53089a0018d9fcbfdc72a47832731","observation_id":"f564919a-d241-4b27-8dc5-089f0e45c941","resolution":{"observed_at":"2026-05-17T00:36:53.549438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-clip: End-to-end multi-grained contrastive learning for video-text retrieval","venue":null,"work_id":"1ca7b654-edab-4102-9edd-addbdacbb62e","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:bcb43bc69a487b88cb6dc6f5a0736b453aba21b07da974dd8531f2dc0ee5ab1b","observation_id":"10b34b71-aa82-49fb-893b-7c79dec90fe5","resolution":{"observed_at":"2026-05-17T00:36:53.551696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VideoMAE: Masked autoencoders are data-efﬁcient learners for self-supervised video pre-training","venue":null,"work_id":"7093b2aa-0e8e-4192-99aa-be1df9d7dc65","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:46f2249090044db72db97d7b2c4f657cf34ea94ec550111a0c701aacd943fdfa","observation_id":"e835e721-e8bb-49eb-917e-7d8738d2da5b","resolution":{"observed_at":"2026-05-17T00:36:53.554578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07303","last_updated":"2022-03-14T17:06:30Z","snapshot_observed_at":"2026-07-06T12:47:38.925428Z","submitted_at":"2022-03-14T17:06:30Z","title":"All in One: Exploring Unified Video-Language Pre-training","version":1},"cited_work":{"arxiv_id":"2203.07303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.07303","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All in one: Exploring uniﬁed video-language pre-training","venue":null,"work_id":"91bd00d9-4041-47ad-a58d-043b0c543c9c","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2203.07303","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:3536a49a6bb29d0dc035b9fc92c5623fb0c49f03be3e84c9afc1b9279d706c82","observation_id":"d592edaf-3d7a-463e-a2e4-c647938fae95","resolution":{"observed_at":"2026-05-17T00:36:53.363109Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"55f4eacf-ec6c-4f8a-8105-fc5d93240508","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:553c0fa633a2445ea4feb9ef3e5855a32137d17e80e923d4cd17ec18b11c94bc","observation_id":"ed71fbf0-5b96-40a4-8947-b5943e26dab4","resolution":{"observed_at":"2026-05-17T00:36:53.556938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.05691","last_updated":"2021-01-28T01:43:34Z","snapshot_observed_at":"2026-08-10T17:29:43.107061Z","submitted_at":"2020-01-16T08:28:57Z","title":"Learning Spatiotemporal Features via Video and Text Pair Discrimination","version":3},"cited_work":{"arxiv_id":"2001.05691","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2001.05691","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning spatiotemporal fea- tures via video and text pair discrimination","venue":null,"work_id":"f9fa1d6c-64f0-4b92-bdb7-a4a98296fd68","year":2001},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2001.05691","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:d514441afe5d8114dde5e72139124b2e29ba8fc9f2d47cb9fb6f1998e878001c","observation_id":"f6427790-add4-4399-ba0e-9dd4f2a67756","resolution":{"observed_at":"2026-05-17T00:36:53.277470Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":"0801f460-46ab-4c3a-9d8e-8e26430587da","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:afc77b73f28e20155687d5997bc9b490af4f90ad48d052eba1d6bdf17cdb90ac","observation_id":"a1d8d62b-3f27-4931-b883-56bd2c53aaa5","resolution":{"observed_at":"2026-05-17T00:36:53.559327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"dfe82518-59dc-4f5d-b3e1-ff60b8870e03","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:766b9bba7d37aca65e7c1f52b1346eb45f4252f1bd48830a224bc2f8d85580ec","observation_id":"1e26c95d-0036-43ad-9c94-acc008c81bca","resolution":{"observed_at":"2026-05-17T00:36:53.562142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01678","last_updated":"2022-04-04T17:50:41Z","snapshot_observed_at":"2026-08-11T19:50:25.147378Z","submitted_at":"2022-04-04T17:50:41Z","title":"MultiMAE: Multi-modal Multi-task Masked Autoencoders","version":1},"cited_work":{"arxiv_id":"2204.01678","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.01678","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"James GC Ball, Jana Annika Wicklein, Zhengpeng Feng, Jovana Knezevic, Sadiq Jaffer, Anil Madhavapeddy, Clement Atzberger, Michele Dalponte, and David Coomes","venue":null,"work_id":"0ebe858c-5606-48d3-9631-48f991ef016b","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2204.01678","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f536ff77b337ff57e7104180f18afd33f9d09dd4f1f3ef226acadc8b600133c0","observation_id":"97522ffd-971f-482e-92f4-fa7cc729d036","resolution":{"observed_at":"2026-05-17T00:36:53.332561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.12681","last_updated":"2022-04-16T04:21:26Z","snapshot_observed_at":"2026-08-04T04:22:15.975890Z","submitted_at":"2021-11-24T18:31:20Z","title":"VIOLET : End-to-End Video-Language Transformers with Masked Visual-token Modeling","version":2},"cited_work":{"arxiv_id":"2111.12681","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2111.12681","snapshot_observed_at":"2026-07-03T00:57:30.204945Z","title":"Violet: End-to-end video-language transformers with masked visual-token modeling","venue":null,"work_id":"c7602525-8155-4a61-bd4e-abf06c26e6e7","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.12681","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:4069f1e41ed8c8d032aa1e09095070a8124da59e36ecca70f61b32eccffb7e28","observation_id":"f1b3dfd1-d7f2-4246-a5ad-9a97e7ede817","resolution":{"observed_at":"2026-05-17T00:36:53.335861Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07160","last_updated":"2022-06-14T20:43:25Z","snapshot_observed_at":"2026-08-11T17:12:54.747904Z","submitted_at":"2022-06-14T20:43:25Z","title":"LAVENDER: Unifying Video-Language Understanding as Masked Language Modeling","version":1},"cited_work":{"arxiv_id":"2206.07160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.07160","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavender: Unifying video-language understanding as masked language modeling","venue":null,"work_id":"a66881b8-36b2-40f7-94ff-15730443b004","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2206.07160","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:cfe44249cdca5acd8d308b2066f216f7d52b03d3974e9b3eecb3aa688035a4d3","observation_id":"43d26c3f-fb83-487a-9878-515c56343167","resolution":{"observed_at":"2026-05-17T00:36:53.351832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlot reserve: Neural script knowledge through vision and language and sound","venue":null,"work_id":"44919ade-b827-4478-a1d5-00a365c24b03","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ff95630b711e44f4b7ab3967aef7558822685d8dd1af06964d9ddd23685240f2","observation_id":"37845baf-0dba-4d3b-915d-9899e0d124a2","resolution":{"observed_at":"2026-05-17T00:36:53.564481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised visual representation learning by context prediction","venue":null,"work_id":"f402c652-2aa9-44e8-a76e-4cc0384fab0b","year":2015},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:9c5cae62ecebd85d0d497b0ae144ecb45c9f10a137bd59b144351c9d09da6c98","observation_id":"ae004afd-d140-46f7-b35a-d7c0c2c74132","resolution":{"observed_at":"2026-05-17T00:36:53.567120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of visual representations using videos","venue":null,"work_id":"74930d9b-49cc-4d73-9321-d6a77fdebac7","year":2015},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:c624a60c74d1cc48ee538bf0a3c2d6de1b8a10aede5727e9009814318cf8cf35","observation_id":"4723c39e-4cc3-4f7d-8350-a19b0649b9f5","resolution":{"observed_at":"2026-05-17T00:36:53.568990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":"2937796a-76b4-4b81-ad23-05d4f6c5ddfb","year":2016},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:c6d8585c7d41ade835cec46604628ea0667899035d1f7775214be0d205698806","observation_id":"fb44d790-7eca-4b01-8e83-85d44d9d1a76","resolution":{"observed_at":"2026-05-17T00:36:53.571331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Colorful image colorization","venue":null,"work_id":"8f8e2a18-d884-4178-8eff-0a4dead5525d","year":2016},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:bf42707458ce12f2c20fd3b924d5bd0788cf9265801664df5205349388b77b8d","observation_id":"f4619852-2280-447c-8202-519597bcd303","resolution":{"observed_at":"2026-05-17T00:36:53.573515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09113","last_updated":"2022-10-21T09:16:43Z","snapshot_observed_at":"2026-08-09T11:59:00.129367Z","submitted_at":"2022-05-18T17:59:59Z","title":"Masked Autoencoders As Spatiotemporal Learners","version":2},"cited_work":{"arxiv_id":"2205.09113","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.09113","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders as spatiotemporal learners","venue":null,"work_id":"786785f7-8bab-4048-ad43-1188705feea4","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2205.09113","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:65b3334105898516b337c6d3e6375b769106c9fcdd458611b09b6be1e4c8dfd2","observation_id":"08324d3f-53f6-433a-b574-a1e9211bf325","resolution":{"observed_at":"2026-05-17T00:36:53.282866Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unsupervised feature learning via non-parametric instance discrimination","venue":null,"work_id":"2cc71166-c6c1-45d5-852d-255dabd33fdd","year":2018},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:06c2e6ef74ba04ee8c0ee1a2b76edec2554507a0e31820ab3b3b13c0b63f0aed","observation_id":"769a66e5-c946-46e2-abf9-94ed606d4775","resolution":{"observed_at":"2026-05-17T00:36:53.374533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"8ddeb5b9-874c-489a-bdd2-5514011e01fd","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ea63ce0cae2a2eb65a5c1c4de9692c70bf651fa31d05c847b506856b1f4bfd03","observation_id":"2f4b1f9b-58dc-4d18-9ce9-698117bd4380","resolution":{"observed_at":"2026-05-17T00:36:53.376775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"6476bf37-de3b-43d8-892f-67b5b36f4784","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:4f53afc1fb8e87453f20e32bfb1d514b7a225006d5d2cdaa80bbb70270ac6434","observation_id":"54313e2e-2c6d-4fa7-bfb8-31add93d391e","resolution":{"observed_at":"2026-05-17T00:36:53.379017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"b6be625c-a6de-4c38-b4d2-71818a72dfbd","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:41d9a232f657de7ee2996d699d5989e0de8ad4027cc859b26b95405fee97a771","observation_id":"a17948b0-4a8a-49c2-a591-67fba7f18663","resolution":{"observed_at":"2026-05-17T00:36:53.381372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":"1fccc07a-455b-488e-adf1-f4f6d5e3a02e","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6777811e247c6abcadb171739bec89229a935d13844bd1a8d4b4c4107606c4fe","observation_id":"e98d55ec-8417-4f5b-b7ca-863d1716455b","resolution":{"observed_at":"2026-05-17T00:36:53.383305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative pretraining from pixels","venue":null,"work_id":"c80da154-0889-472a-a5d9-919a74585054","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:fc7a8fac57cbf7460ba33d288c9573cb6b1cd74415865b0f98d126c7e83d278e","observation_id":"077e4be3-83a6-4924-8e52-f8386b83e1b4","resolution":{"observed_at":"2026-05-17T00:36:53.385547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"b73fe3c4-95ae-4f92-8401-a6a5adbb8e5a","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:697ea19e6f90795114fb5a6b063a981e90965a3614a3df2c3dbbd8c3476c64e6","observation_id":"cadc7453-4fd4-4dc2-ad4b-8fb9d1ee65e8","resolution":{"observed_at":"2026-05-17T00:36:53.387682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"2a682280-b7be-4331-9696-451b0178d7ab","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:3e763f8784a1c4abac2ea0ef9d62828da6ae44e8b06563c16fa3feef91bc29ba","observation_id":"125ac4f9-8d1b-4e65-b57b-9c292d5d28cf","resolution":{"observed_at":"2026-05-17T00:36:53.389686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end learning of visual representations from uncurated instructional videos","venue":null,"work_id":"baa1286d-3fc1-41f9-a3f8-c9a951999879","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:48eea6c71e472ef9aff0f9364e18fbf1d9a383c5419ccabec5517b847e988286","observation_id":"25cf0191-21ab-4879-bf31-b02cacfb6501","resolution":{"observed_at":"2026-05-17T00:36:53.391711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":"2109.14084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-07-04T06:39:37.380967Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":"509d3b12-48dd-4984-9d28-a28d917f0b1c","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:64fb95ba8450aa0def4c8fa1ac4052c49181148af51af1b8472a78e4963b4297","observation_id":"1eaf6c1f-7f3f-4dbd-8fe1-793a40eb840d","resolution":{"observed_at":"2026-05-17T00:36:53.372393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up vision- language pre-training for image captioning","venue":null,"work_id":"09a20ceb-4cde-4c6f-97ac-96b06fce2cf8","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:02dca55d090c1ec5f67961fa6711d6b30b8860c90a81c4e5788a93a2d4b3b191","observation_id":"0d455d99-3861-4248-9217-1b71bfe27ee0","resolution":{"observed_at":"2026-05-17T00:36:53.393606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical study of training end-to-end vision-and-language transformers","venue":null,"work_id":"871aa2d4-812d-4b0d-af66-92defba0bf97","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:102f1b4deeba817a67742594d612fd88978d37156c2a81d34298087b39225ee3","observation_id":"45bb48ee-1534-460b-a89a-e4629a7ed4aa","resolution":{"observed_at":"2026-05-17T00:36:53.395470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ca50ad317f9dfe20cd94b8b47b4f8db31b3c908197b20208834f2f5970faa82c","observation_id":"cb05c3d7-b7f6-4b6a-aace-20d7ebb73939","resolution":{"observed_at":"2026-05-17T00:36:53.287756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2111.07783","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-07-11T03:07:53.330969Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":"cs.CV","work_id":"ed22ea81-4b1d-4b6e-96fc-aa013a968e9a","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6a6c9fc087c321591738743663bf309417403f185619ffb7f3b38b245337451a","observation_id":"394409b5-09ee-46ff-b7a7-49f06cd927e2","resolution":{"observed_at":"2026-05-17T00:36:53.293435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Murphy, and Cordelia Schmid","venue":null,"work_id":"bd228181-4788-4533-a1ed-ee050e8ab84b","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f0a30ac36ad56d7bc2cf06c64b011d0c5819faa672473382d3f4fd3e9a1596ed","observation_id":"94c2227e-51bf-41c5-9628-3d813875b9b9","resolution":{"observed_at":"2026-05-17T00:36:53.397390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actbert: Learning global-local video-text representations","venue":null,"work_id":"d3004fc7-15c5-4a57-98f9-cce663656302","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:29cd7ded0ebf0e34f5feed56706a7391faa35f6c8dc70c596816711488c30583","observation_id":"a3db7f46-f5c6-47cf-ac64-c8eacf823504","resolution":{"observed_at":"2026-05-17T00:36:53.399479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Less is more: Clipbert for video-and-language learning via sparse sampling","venue":null,"work_id":"65e1fec9-33ed-4d0a-83ad-af8cf2139d8d","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:14cf9677820ec0226711d4880ef4b7c03266bf517827d791f34949e4606e6564","observation_id":"ab0c1b3e-9a54-42b4-9d74-cbac6ed77c38","resolution":{"observed_at":"2026-05-17T00:36:53.401395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"57dcdfc3-a2f7-42bf-ae27-390c74cd9306","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:8243ec791f79bdc0bbd9cc4eda15acbc9986f28212c6012ea82323c8b72d675d","observation_id":"ed286fd8-33ec-4656-841a-605e03c91755","resolution":{"observed_at":"2026-05-17T00:36:53.403232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-07T04:39:25.258902Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":"2211.09552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-07-03T19:08:49.809225Z","title":"Uniformerv2: Spatiotemporal learning by arming image vits with video uniformer","venue":null,"work_id":"cb4c2612-0c2a-4ab9-9dde-7031260274d1","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f7b2e9c509e6dd76b29d8d98a2b5d1fad413f7ab5a4631e5694ae102a66c4da1","observation_id":"df6acf2d-ce08-4040-9031-ec1f5337f94f","resolution":{"observed_at":"2026-05-17T00:36:53.339682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09529","last_updated":"2022-11-17T13:45:06Z","snapshot_observed_at":"2026-08-10T05:30:20.599642Z","submitted_at":"2022-11-17T13:45:06Z","title":"InternVideo-Ego4D: A Pack of Champion Solutions to Ego4D Challenges","version":1},"cited_work":{"arxiv_id":"2211.09529","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.09529","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvideo-ego4d: A pack of champion solutions to ego4d challenges","venue":null,"work_id":"54773a77-a0f2-43d2-9158-858d1d0652f9","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2211.09529","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:aaf5c80c2fbddb168249e96b942918f68135276c4567162dccb5c27476f77c75","observation_id":"daf2cd83-44df-4d94-9636-da67314f460f","resolution":{"observed_at":"2026-05-17T00:36:53.342706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vivit: A video vision transformer","venue":null,"work_id":"14137101-8917-4a85-a1ce-d6fe69d3933c","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:b9fe5829fa79d78d0c8ef7501f3cd270a9d949ac37f7760bbe2507cffa8767e9","observation_id":"125f031c-56af-4fb1-b9c2-54c26841c724","resolution":{"observed_at":"2026-05-17T00:36:53.405084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video swin transformer","venue":null,"work_id":"f432cbaf-95d8-4a25-bd1f-b4f190012d7d","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:4a75995d870d3dd24d00ba3136fc3f13d8d689f0a677b68fac7655c34a6bda3a","observation_id":"a0f9a437-972d-46b2-8949-b337cfbdb66f","resolution":{"observed_at":"2026-05-17T00:36:53.407101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":"79546e30-c83d-42af-9aea-45009685239d","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:aa6714bfdcd534ae1df885576ab0f65ae8e43d9c09a67f09d8e0991c58f17e45","observation_id":"3c835898-0ae6-401d-baf2-dc100efc610b","resolution":{"observed_at":"2026-05-17T00:36:53.409165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bsn: Boundary sensitive network for temporal action proposal generation","venue":null,"work_id":"7cf53323-4c23-445b-81e8-cc7df67f4cb2","year":2018},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:806671be9d8a2c456e1f27488d03b9eb1370c2117726477330a315ba6b798f02","observation_id":"cb220de4-fd55-4eb4-88c9-1ec6f7541301","resolution":{"observed_at":"2026-05-17T00:36:53.410972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bmn: Boundary-matching network for temporal action proposal generation","venue":null,"work_id":"4026ac84-7796-4b5c-b46f-93a3140c97ac","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:26d2c01198333c133f9cf0a849fb06c6c726758b649f8e9f5a42251ccafe2f37","observation_id":"f153cb14-1f77-4a63-9bc8-deed1fe2a383","resolution":{"observed_at":"2026-05-17T00:36:53.412743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Augment your batch: Improving generalization through instance repetition","venue":null,"work_id":"3e6bd86d-4921-450a-bd2c-88811aa36275","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:2331b7dd05a93556fcdcd3e067fc8027774accb71a4f46c86350b173cab36d4b","observation_id":"cfb36e00-385d-4d5f-b291-c5053f1307ec","resolution":{"observed_at":"2026-05-17T00:36:53.414525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uniformer: Uniﬁed transformer for efﬁcient spatial-temporal representation learning","venue":null,"work_id":"f0fb8f87-1b64-46ea-a401-34a4b4c1f421","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ec231fae118bf45e94289cd094e61bcf1fdb5d4f572fd552f32e7887c0b5c5f3","observation_id":"a556e19c-29e9-48f8-9636-437f237f3bcf","resolution":{"observed_at":"2026-05-17T00:36:53.416433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal segment networks: Towards good practices for deep action recognition","venue":null,"work_id":"d05536f2-4e00-487d-a7fc-89b99f7f8da1","year":2016},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:583b1d9dc82a9384c7b26a5302f00429bc1481d254b325d5ca2950e1b564809c","observation_id":"553d1d0d-c341-41f6-b7f2-3cc8e6a5c298","resolution":{"observed_at":"2026-05-17T00:36:53.418486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Howto100m: Learning a text-video embedding by watching hundred million narrated video clips","venue":null,"work_id":"a92de71b-23b3-4618-8f90-2a70130002fc","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ab2c313f4fa65a9516c939f284777819ab06232fb8af7a88db57939697f63a66","observation_id":"4c47372a-b8a2-42a4-8a05-2c885d9bebc2","resolution":{"observed_at":"2026-05-17T00:36:53.420442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ava: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":"597df64e-f77b-4685-8ad4-38d28ed0e897","year":2018},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f80d67efad306d151c57fc92b82aac1461ec6bc5848da78729b8228730d2489a","observation_id":"06eee4ec-f8b8-422c-8a69-cea7ef01bac1","resolution":{"observed_at":"2026-05-17T00:36:53.422380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"something something","venue":null,"work_id":"9a683c7f-488c-454e-a2d2-5f2f2a2d4583","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:b608e2cba7ecc6c0af99752701a1e2fa29ff0860adf6fb11d1227bf5adbd40af","observation_id":"f365664f-37db-4ab0-9990-5cf0a2a5d10d","resolution":{"observed_at":"2026-05-17T00:36:53.424590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":"1808.01340","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-07-09T11:16:11.465544Z","title":"A Short Note about Kinetics-600","venue":"cs.CV","work_id":"851b1623-6feb-441e-8849-b07f1753f22e","year":2018},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:7484627977791030014584b79dda1aa5aa17c722d18a38a75508e99966dcc347","observation_id":"a79c3217-3bd8-4419-ac62-458aabe245d0","resolution":{"observed_at":"2026-05-17T00:36:53.312698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":"1907.06987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-07-04T09:49:44.399575Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":"6eaebe96-5819-4220-84d5-dd888c79b8f4","year":1907},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:f400540cd84b42d807a3206329db7dbd5ba0cec2a3660554d293081fcb4cf917","observation_id":"25073e3d-7956-4d69-b3ea-815b437f8a5d","resolution":{"observed_at":"2026-05-17T00:36:53.317677Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:7943b0f7d13cf35812b60066e4214bbe63185d8ebb3b1dc1c7f63f81d581c1c4","observation_id":"a7473c7a-7460-4718-ae07-d8ac09ecd542","resolution":{"observed_at":"2026-05-17T00:36:53.321624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:7ee18a62fc16fe4a124b18b6dee20a7b92547efad48a8a5d33e642a33f107bfc","observation_id":"49c0baeb-7464-4264-972c-23a6bdcbc89b","resolution":{"observed_at":"2026-05-17T00:36:53.325661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ean: event adaptive network for enhanced action recognition","venue":null,"work_id":"d1d22db6-9e47-40b1-b8b1-3f72ce66da4e","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:322b7825ae5cf10d8834f51ca1bb60cddd7a2e3e19c64043ef286e45bc6f3aa4","observation_id":"28f5ce3e-010a-4d07-bc33-0c600825708b","resolution":{"observed_at":"2026-05-17T00:36:53.426987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"2486c481-6ffe-4a35-8e2b-9bb2d32c6cc9","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6f9a615c5eefed92070bda16aaba5ce6b32e159fab4bf55720edd1d977e096f5","observation_id":"e6fb0d7a-bf64-464e-b8bd-c12b02062df7","resolution":{"observed_at":"2026-05-17T00:36:53.429068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Temporal context aggregation network for temporal action proposal reﬁnement","venue":null,"work_id":"862e3439-2841-4bc5-aa43-1a1f16b23eec","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:84846f4af33b3abf01619d3d5c0d684d6ee86dab8657228d8b97785002baa718","observation_id":"fe0f9f6c-549b-44d7-891d-afa458f2b9ed","resolution":{"observed_at":"2026-05-17T00:36:53.431590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tsp: Temporally-sensitive pretraining of video encoders for localization tasks","venue":null,"work_id":"c15c5a5a-c2f7-4f78-a3ea-3ba2d0e1c154","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:e383ef805dc79fa368260f68c861a697a08f5d05f27203ed2c34c7eae97acc1a","observation_id":"b520d146-266c-40ca-933f-6f726ee4d751","resolution":{"observed_at":"2026-05-17T00:36:53.434466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Actor-context-actor relation network for spatio-temporal action localization","venue":null,"work_id":"b7172b17-2fe5-4c64-9ee6-efdf503c6134","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:8b85974f8f6532ee2fbba72e4ed54d225fc6226d893680c9f230d3a5c18e970a","observation_id":"2ab8484b-ddaf-4b2d-9574-27f03a4e1f38","resolution":{"observed_at":"2026-05-17T00:36:53.437790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08061","last_updated":"2021-06-16T07:00:12Z","snapshot_observed_at":"2026-08-11T04:24:59.166048Z","submitted_at":"2021-06-15T11:40:18Z","title":"Relation Modeling in Spatio-Temporal Action Localization","version":2},"cited_work":{"arxiv_id":"2106.08061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.08061","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Relation modeling in spatio-temporal action localization","venue":null,"work_id":"156d5b27-4212-4294-8be8-94555b1ae2d3","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2106.08061","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:22a86f0d2bec3f193e7c96dde90006b7a9ba62359090086a3e6b4773275558fe","observation_id":"1cda90a1-64f6-429e-9734-f7175806b97a","resolution":{"observed_at":"2026-05-17T00:36:53.348925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":"e3d9769b-50d2-49ad-81a4-5ae6020c77e2","year":2015},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ea6f37b9faa8bae9b746011f7f85345c426a1f4c5ed8dd292a3e2798389898d1","observation_id":"1bbe1b0d-3e33-46ad-94c2-9f3cbdf14c85","resolution":{"observed_at":"2026-05-17T00:36:53.441544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hacs: Human action clips and segments dataset for recognition and temporal localization","venue":null,"work_id":"5dfce9d2-d520-426f-a705-84d65b0316f5","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:326a1d941e0a84aa8b9cdeaec47f9e08eae79846c477eb56a06b8a237d4f9577","observation_id":"b058bb58-df2e-4099-800b-aac3f4266817","resolution":{"observed_at":"2026-05-17T00:36:53.444418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":"d3a4ddf1-2901-45d0-9ab4-f145a69549dd","year":2011},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:3f83f8d1af43c24d063bcefd8a7f4d9095aef1ab656d0f6f199b3aeeb86e6011","observation_id":"21385d48-09e2-42cc-a87e-aa3ed4f73611","resolution":{"observed_at":"2026-05-17T00:36:53.446490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"in the wild","venue":null,"work_id":"e08e4cef-0c16-4f55-a6ac-b4ccc9366e4b","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:699a3d7cbc69b7daa4c972baef752aadf68cebca6f565a51e92e51aa165b062c","observation_id":"a441b6ad-3c9a-4642-9523-12edc9633dfb","resolution":{"observed_at":"2026-05-17T00:36:53.448820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fineaction: A ﬁne-grained video dataset for temporal action localization","venue":null,"work_id":"d3633a2f-18b7-48d3-a9b6-f45f5c077618","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:9dd0a1984bdbdb97d5eb5cb837d0adb710af98cf64233988fea0000ba299261f","observation_id":"e58262bb-91a9-4abe-9fe1-5ecb4a666e31","resolution":{"observed_at":"2026-05-17T00:36:53.451543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00214","last_updated":"2020-05-20T17:40:28Z","snapshot_observed_at":"2026-08-09T00:23:40.293592Z","submitted_at":"2020-05-01T04:17:14Z","title":"The AVA-Kinetics Localized Human Actions Video Dataset","version":2},"cited_work":{"arxiv_id":"2005.00214","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.00214","snapshot_observed_at":"2026-07-01T09:45:39.584394Z","title":"Ross, João Carreira, Alexander V ostrikov, and Andrew Zisserman","venue":null,"work_id":"67605848-2b5a-4fec-80af-9d276991fc99","year":2005},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2005.00214","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:7cf2c3c1bae96c0b5a39198c0d77c3e36a1671639613cd7af42bcb394f959352","observation_id":"305de34c-d1fc-4b85-9f6a-546e3a9cb41d","resolution":{"observed_at":"2026-05-17T00:36:53.369430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"3a7c7b56-4992-4a53-8238-3d5c2ab33baf","year":2014},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:a89d49b7ba3fb4c4a0b3dae620d67b797fd6d8a95ced71d463414b8eb73b3a5f","observation_id":"95ff95e0-14bf-4c78-96b8-15bb76c2dd87","resolution":{"observed_at":"2026-05-17T00:36:53.454159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask r-cnn","venue":null,"work_id":"669de571-b3b5-48a1-9c06-906c2191da69","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:9308e70d00f2f6d9e54a0c5b87c1034795fe1c7e0dc70f7d2ddf7f684412890a","observation_id":"4bca6380-1687-4bec-a8b5-85130b0ec985","resolution":{"observed_at":"2026-05-17T00:36:53.456500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous interaction aggregation for action detection","venue":null,"work_id":"912368db-0170-40ac-bf09-15675d4f022b","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:10337101f906e9ef4ef9a44cf1dc91793949de09d6113079df4ff68da94a9c33","observation_id":"395d12ae-d898-47ed-ac60-b6fc9cfe6bb8","resolution":{"observed_at":"2026-05-17T00:36:53.458816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ts2-net: Token shift and selection transformer for text-video retrieval","venue":null,"work_id":"9ef0ab48-a7a1-497c-8a32-f08073fcf656","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:96e1438c1f7e58ffa50b9506a26265492879482c7151ddc8268647107860af10","observation_id":"4dc41450-fea2-4490-b286-f4a94198cb14","resolution":{"observed_at":"2026-05-17T00:36:53.461068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bridging the gap between learning in discrete and continuous environments for vision-and-language navigation","venue":null,"work_id":"7951f0ca-740c-4d15-95e8-bc5a5e287552","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:15a12628ed8b56823ce94842ff29f55ec9828fadff46c86c3c8ed3a77b17f46d","observation_id":"2fab92fb-d8e8-4498-bf7c-4907c4130824","resolution":{"observed_at":"2026-05-17T00:36:53.463399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11610","last_updated":"2022-06-26T14:37:08Z","snapshot_observed_at":"2026-07-06T13:23:55.107856Z","submitted_at":"2022-06-23T10:36:53Z","title":"1st Place Solutions for RxR-Habitat Vision-and-Language Navigation Competition (CVPR 2022)","version":2},"cited_work":{"arxiv_id":"2206.11610","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.11610","snapshot_observed_at":"2026-06-30T15:44:49.379219Z","title":"1st place solutions for rxr-habitat vision-and-language navigation competition (cvpr 2022)","venue":null,"work_id":"c054ebf1-1484-44e0-947c-af42b68655e2","year":2022},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2206.11610","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:e294e05eb5c1f8ea6cc69380482deaf5552cb335f4fcac08e59c3c56c36e2ec0","observation_id":"6a182d2a-0e0a-4dae-af1e-d1df9e27c009","resolution":{"observed_at":"2026-05-17T00:36:53.298941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04290","last_updated":"2021-11-22T09:35:30Z","snapshot_observed_at":"2026-08-09T21:40:39.573851Z","submitted_at":"2021-09-09T14:10:43Z","title":"Improving Video-Text Retrieval by Multi-Stream Corpus Alignment and Dual Softmax Loss","version":3},"cited_work":{"arxiv_id":"2109.04290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.04290","snapshot_observed_at":"2026-07-02T14:27:02.995751Z","title":"Improving video-text retrieval by multi-stream corpus alignment and dual softmax loss","venue":null,"work_id":"785bfc5c-1e8e-43e7-91cd-6cf49d363de2","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2109.04290","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:df98ecfbcb3fc8fe6943b7c336ac5da72d295e104e75841d05aae252aca30373","observation_id":"779a5061-293a-4889-b7ae-50a2d3404ad7","resolution":{"observed_at":"2026-05-17T00:36:53.304132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"9030673c-4043-468a-8f28-3e63c5c43fc2","year":2016},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:d206c007bf2368dd65a8370aaa0c98ac8fc34fe3b00cc6d25b842608ef501dbc","observation_id":"6b002104-5b7f-4200-8540-ec9801a7d1a6","resolution":{"observed_at":"2026-05-17T00:36:53.465903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning for video classiﬁcation and captioning","venue":null,"work_id":"e9eaa951-9c1f-47ff-916a-6e53858308df","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:b31bdc0432e3a96d33e711dbb376b30dadb4dc3d063d949d2eefe6c36c5f19a8","observation_id":"35ac8685-0577-4375-8322-4b7df5fdb57b","resolution":{"observed_at":"2026-05-17T00:36:53.468135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Localizing moments in video with natural language","venue":null,"work_id":"f1dd5776-b6e2-455f-8498-13d844444751","year":2017},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:1b066ad17c5d0f4542a8f08f94db9dd9834cb5c44fb1817950fb25b691dbc849","observation_id":"dc73f63c-03e0-4c40-b633-dcca7f1df363","resolution":{"observed_at":"2026-05-17T00:36:53.470503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A dataset for movie description","venue":null,"work_id":"225352f1-bf4a-46e1-9d88-10f993d53abb","year":2015},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:ec1646192a02639dc48fe3a2d3feeb864f64ed52280c07ef2698392af0fc8774","observation_id":"4e29b554-3fed-44f5-b3c5-7e01be66b7ac","resolution":{"observed_at":"2026-05-17T00:36:53.473009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vatex: A large-scale, high-quality multilingual dataset for video-and-language research","venue":null,"work_id":"873fef9a-621a-4339-a2f1-52c86081bfdc","year":2019},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:35de63aeebf6b97ec7ebcd4881fd2cafbac185eed40adb9eb04bb11a7c366bfd","observation_id":"b8dc8f73-21ef-41d4-a06e-5d4b69662908","resolution":{"observed_at":"2026-05-17T00:36:53.475759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":"c2f21f33-85d8-4a8e-b721-219c02a863d3","year":2011},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:0d91e2284a9b6fa8b0580f66d19c16cba31b4e48fbf28bc00bf4d28a9a69ef76","observation_id":"0ab77ef9-76a9-42c5-95ec-bc1c2c80ac1b","resolution":{"observed_at":"2026-05-17T00:36:53.478587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tgif: A new dataset and benchmark on animated gif description","venue":null,"work_id":"33dcc6e4-ff0b-49e6-bc17-8e9e4941b375","year":2016},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:6b62549fcaa888cf2bb3aeccef756b333aa7ebbe32060b1ebdf5833f08d8a442","observation_id":"dc7b93fb-238a-4ac4-9d47-c0f4619a54a2","resolution":{"observed_at":"2026-05-17T00:36:53.481235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"9cca8f96-2a26-4c26-8a26-f6d975686527","year":2018},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:66d0d4672dc9447a04f1c1f2fcb7908ed46ab3599dd10c65435d6104ad056bb7","observation_id":"afc4b203-517b-48ba-9b13-feab2632f974","resolution":{"observed_at":"2026-05-17T00:36:53.484026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":"907ec391-6f70-452d-878c-a3a29ea31d09","year":2020},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:9267babeb8c95c23945821c0ebfe5e7fbcad06cb702ce280c15df35527eef4af","observation_id":"355c2f4b-df10-4abb-bffc-11ef4e25dae4","resolution":{"observed_at":"2026-05-17T00:36:53.486843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":0,"verified_exact":21,"verified_fuzzy":76},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 100 inbound Pith citation observations for arXiv:2212.03191."}