{"as_of":"2026-08-08T17:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83af50ab9f193a29b6494e8d32f0ab75bd492a4140a91cb2d0b7d749a435eed6","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T00:16:43.190961Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06856/citation-record","integrity":"/paper/2607.06856/integrity","json":"/paper/2607.06856/citation-record.json","paper":"/paper/2607.06856"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09985","last_updated":"2025-06-11T17:57:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-11T17:57:09Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","version":1},"cited_work":{"arxiv_id":"2506.09985","doi":"10.48550/arxiv.2506.09985","metadata_source":"pith","pith_arxiv_id":"2506.09985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning","venue":"cs.AI","work_id":"a9c28401-f16a-4933-89f0-788e2f94e52b","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2506.09985","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:f6c2d671184ae2aaa224c96a81a1dc517498d37129cdb7486518af170d29150e","observation_id":"4226e5dd-79a6-49e8-90fb-2d5b018c1d64","resolution":{"observed_at":"2026-07-10T00:26:39.626831Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.559938+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:b41b9a0dd1e98a31cd4e33f8011fda3a77156b37c28996622a2f1b3b93d2571d","observation_id":"05d12c6b-149e-43d2-8139-2d3df8eb2573","resolution":{"observed_at":"2026-07-10T00:26:39.650395Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8922.2021","doi":"10.1109/iccv48922.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Walk in the cloud: Learning curves for point clouds shape analysis, pp","venue":null,"work_id":"3820f598-11b0-45c3-8c99-0079181ac0a7","year":2021},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:bd306b97ca337ea1be6d3c20795a6f7d22fefd437570cd42f889c8c80c0d5684","observation_id":"afb13ef3-a1bd-48c4-9abc-a824187c2672","resolution":{"observed_at":"2026-07-10T00:26:39.079490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15212","last_updated":"2025-07-09T16:58:07Z","snapshot_observed_at":"2026-08-06T10:25:48.518948Z","submitted_at":"2024-12-19T18:59:51Z","title":"Scaling 4D Representations","version":2},"cited_work":{"arxiv_id":"2412.15212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.15212","snapshot_observed_at":"2026-07-10T00:26:39.628379Z","title":"Scaling 4d representations","venue":"cs.CV","work_id":"d708ea1a-01d4-401d-ada6-b36a346e7bf9","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2412.15212","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:a85e10cabeff087e8732d37574687142d05915c8a89d511427cad163b2a82841","observation_id":"a3458577-a4a7-4f4c-a660-a63981166db6","resolution":{"observed_at":"2026-07-10T00:26:39.630147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:5d4f248eb2841a72792800a5df0a2bff6a5e59a3b729d14eb879fbc501a34540","observation_id":"9620d0e2-5efe-4e86-8c78-32f82fb9e2fa","resolution":{"observed_at":"2026-07-10T00:26:39.647632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1017/s0140525x12000477","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Whatever next? Predictive brains, situated agents, and the future of cognitive science , volume =","venue":"Behavioral and Brain Sciences","work_id":"ec83b012-c6d1-4ab3-a254-4d8b9dfed604","year":2013},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:c472caf1293c979a5ba620a680060d2f9016e09b3b9fa1a8f3b1c027f98632b2","observation_id":"fe557c13-b1d6-4c7e-8957-92ac7a91ba7f","resolution":{"observed_at":"2026-07-10T00:26:39.075687Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:50.717071+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:50.717071+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.254845Z","title":"Accessed: 2026-04-17","venue":null,"work_id":"a3ffc7c2-fde9-4a4d-9a0d-3d5e459d14ad","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:18030d1692e9d372e513844b497a990f503e3c2786dcc6059d488de8ef7bf638","observation_id":"21174190-d36d-49e8-842e-c936c346c4fc","resolution":{"observed_at":"2026-07-10T00:26:40.255962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":"2408.00118","doi":"10.48550/arxiv.2408.00118","metadata_source":"pith","pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","venue":"cs.CL","work_id":"4dd94e2f-2b27-4cbf-88a0-4910f0772a57","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:a19a7813f3be9dfca08e1e82a378f63ca23a720cd113d411334d58ab3fa913df","observation_id":"ae41bede-a22c-4637-8305-daca36e05b63","resolution":{"observed_at":"2026-07-10T00:26:39.641686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.183082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-08744-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:39.071787Z","title":"doi: 10.1038/s41586-025-08744-2","venue":"Nature","work_id":"88a709ea-10ab-4236-8f0d-6105f750a696","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:ce33f71f76a75cd4cb0819352f3641658910064c70f00889f63359baff8f3872","observation_id":"476340bb-1b15-4b50-8511-7afbd7835261","resolution":{"observed_at":"2026-07-10T00:26:39.073411Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-03T19:08:37.881844+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T19:08:37.881844+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:47df4ab59303fd8ebfadd13859aa327a3682bed3f77ae700b670a7ddbd6c9ccb","observation_id":"9485af90-32a1-488e-815d-c0a10451c24f","resolution":{"observed_at":"2026-07-10T00:26:39.644945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-06T07:23:27.418432Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":"2603.14482","doi":"10.48550/arxiv.2603.14482","metadata_source":"pith","pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V-JEPA 2.1: Unlocking dense features in video self-supervised learning","venue":"cs.CV","work_id":"3da7cd7a-c3f3-4e48-9704-4320e54aec60","year":2026},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:069b36d7d1fdfa0eb9f294d2c038588cbebe52add3e0c0b7321d32681c5ac504","observation_id":"54b15358-3c4a-47c0-b59b-da5c8b931c46","resolution":{"observed_at":"2026-07-10T00:26:39.658479Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.252988Z","title":"A simple recipe for contrastively pre-training video-first encoders beyond 16 frames.2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 14386–14397,","venue":null,"work_id":"094f1b1f-7cbb-4819-82f2-2158ca860c30","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:066a89d38d794b5061c8fa52e6a54d325b2905defcf53189144e3f6611862f59","observation_id":"1b609cff-0a19-4121-9a35-6161312c2e27","resolution":{"observed_at":"2026-07-10T00:26:40.254281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8922.2021","doi":"10.1109/iccv48922.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Walk in the cloud: Learning curves for point clouds shape analysis, pp","venue":null,"work_id":"3820f598-11b0-45c3-8c99-0079181ac0a7","year":2021},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:fca0ebab7ecf28dd660949e4799df3d5d6eec4807748e691145b0fc0ed38aa64","observation_id":"c9737ae7-86b5-4b4c-bbf7-8795e08d310c","resolution":{"observed_at":"2026-07-10T00:26:39.075356Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":"2412.03555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-07-10T13:27:05.580089Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","venue":"cs.CV","work_id":"dc984d60-8996-44cb-8163-88e7526073b7","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:c2ccb731458271199c613b7c69b93f7fe0358667ef44df5bcd5eea71f583ae50","observation_id":"2247903f-0719-48cc-8eaf-f2e9a1063933","resolution":{"observed_at":"2026-07-10T00:26:39.653175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:6661be79012d5f9ae3aee7c051049f5ede01eda0a5bdb8dd90c9b8f65534ed7d","observation_id":"9e8f8999-e3ee-43a3-a8ea-35e4c9ddc3c3","resolution":{"observed_at":"2026-07-10T00:26:39.655810Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:afbab1c43952bf603190e0c721b568681b58b820f0652ce410fe837da82ac239","observation_id":"911d4e0d-d8a7-461d-8af8-46884e9f7242","resolution":{"observed_at":"2026-07-10T00:26:39.636319Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:774036f46c5bcf4c425ac539c693c70c0e2d5104d531aa57e6212558701c5cc2","observation_id":"12928339-f65f-4e6a-8c5c-3913658eeaa3","resolution":{"observed_at":"2026-07-10T00:26:39.633409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73013-9_23","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URLhttps://doi.org/10.1007/978-3-031-73013-9_23","venue":"Lecture notes in computer science","work_id":"455df6f5-f5ce-4bd6-81e3-dc86f6b57a2a","year":null},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:b6e2f86b406b7d7944c60a9e70b998347482353bc8a07d7aea966f091ff45a27","observation_id":"7846d0c7-704a-4678-bac8-79df2639d526","resolution":{"observed_at":"2026-07-10T00:26:39.072377Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":"2509.20328","doi":"10.48550/arxiv.2509.20328","metadata_source":"pith","pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video models are zero-shot learners and reasoners","venue":"cs.LG","work_id":"6ef44b1c-944f-4648-b3a3-e5c320f385c1","year":2025},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:205be9945dae5db8fa7723f87596e841152a4b22fdb5e95b60d201e74f8bcd39","observation_id":"aa4ea3b1-c690-484e-a86f-6a14c1f70746","resolution":{"observed_at":"2026-07-10T00:26:39.639035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:32.351277+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.249776Z","title":"14 A Mutualk-NN alignment metric We describe the Mutual k-Nearest Neighbours (MkNN) alignment metric used throughout the paper, following [Huh et al., 2024, Zhu et al., 2026]","venue":null,"work_id":"802eecce-fb25-43ad-887c-e2472219dc9b","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:91c940e547cb081ef03b44ca2f84f0700bb13275ba27c6d5bd1e1056bf78dc08","observation_id":"2362a645-e376-416c-bbee-df51a3d874a0","resolution":{"observed_at":"2026-07-10T00:26:40.250928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.251449Z","title":"Best Single block","venue":null,"work_id":"568db4dc-f0be-4f59-a5ab-4b9c8fefc582","year":2017},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:6c845760a288413b0bf01e77aec741f843d241d2eaf8ab4b2638feb62d94c0e6","observation_id":"bf9563af-9efb-409e-87a2-e19edb9fec02","resolution":{"observed_at":"2026-07-10T00:26:40.252441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.247919Z","title":"The linear decoder presents frames that are sharper, but temporally misaligned with the ground truth, as compared to the attention head","venue":null,"work_id":"525d0f32-185b-489e-b26b-accd9ac8c746","year":2024},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:32df0446f02525b9072162f351d1ad83a8576e0c7bd641c321f014b94024721f","observation_id":"249aafaa-771b-43ac-bd02-f4bc5a525261","resolution":{"observed_at":"2026-07-10T00:26:40.249176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:40.245684Z","title":"It plateaus after 10k steps so that the LLM is still updated very slowly to avoid catastrophic forgetting","venue":null,"work_id":"e8ef9c3c-9e6b-4829-8d8f-b85cd0c9d33d","year":2014},"citing_paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T00:16:43.190961Z"},"links":{"citing_paper":"/paper/2607.06856"},"observation_digest":"sha256:343578cb95538ab585c7d406f48fc02589a0e025ff604c7b6e87babf0b4e9038","observation_id":"f55dd9ea-e6cd-4d07-a874-21a46d25f479","resolution":{"observed_at":"2026-07-10T00:26:40.247348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06856","last_updated":"2026-07-07T23:17:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T00:32:20.564348Z","submitted_at":"2026-07-07T23:17:26Z","title":"Gen4U: Unifying Video Generation and Understanding via Diffusion"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":0,"verified_exact":9,"verified_fuzzy":6},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.06856."}