{"as_of":"2026-08-12T04:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebdfb3b725f0419193d81c9ee9ddaa5551a6e23c868a75a29a1852797192183a","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T03:03:23.071178Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.05758/citation-record","integrity":"/paper/2606.05758/integrity","json":"/paper/2606.05758/citation-record.json","paper":"/paper/2606.05758"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:e049d172cc67cc5f3ab04da19455938449fb41a018b1957582415f781836c838","observation_id":"ccf5a602-8584-4e0b-baeb-56156e970724","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:0ab581b869363356dd612b8c63b869ef08274f9283ab91dd1706889fc63a1b12","observation_id":"e2f5f7b5-a506-4685-b2a3-2377c7674897","resolution":{"observed_at":"2026-07-02T11:46:55.645434Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:263de3b760ab4f4972abc595d15e705b4379057030ea97ce473a95f393526908","observation_id":"abd0245b-9c31-4e3f-a3f4-e997f35acf6e","resolution":{"observed_at":"2026-07-02T11:46:55.648478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:99bf5db6e294c0f0421ab67b3e64bdd8ca3867e01cb8c05b54ec1ecc677e53a6","observation_id":"bbbd61e1-c8f3-420c-a162-e50a31b2b5cb","resolution":{"observed_at":"2026-07-02T11:46:55.633298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:21f47455ecad2e0c60ddaa23d44a089aa7248a985bb0fc5456459bae57e6f404","observation_id":"49ad2854-97ea-48a3-ad4a-d0b4ee09e0b1","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:3408287278806dbbbfb4662c3a005cbe1ba6e60841f1b9542e8e0926239cc7a8","observation_id":"369a943b-0c55-4b83-845c-c7f3658c6899","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":"2510.13778","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-07-07T14:03:48.568825Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","venue":"cs.RO","work_id":"8a11d29e-4bf8-4a9c-a97e-d87e7350dd9c","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:ae06b2f9c0477f7d4b6577a17f00ff7c6684b44646b9cbf02207e78b370c900b","observation_id":"a47bdf3e-2509-4aa9-9c72-5f31048fb6c8","resolution":{"observed_at":"2026-07-02T11:46:55.638894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:4f70088f32cef3846740749258f22343c590d724c9a6da96593b477922bf16a6","observation_id":"0495db46-511b-4d82-9032-17f7a70d1d70","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-02T06:45:30.387180Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":"2601.10611","doi":"10.48550/arxiv.2601.10611","metadata_source":"pith","pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","venue":"cs.CV","work_id":"f0dc2969-bd90-4a5d-81df-d557352690b6","year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:e1923ac159c9d65d00432fa9363e1426f1d2aca260bdbeae32e6ba138ad371c5","observation_id":"f13f6095-bf0e-4f98-9dd9-28d7ac9ae1f4","resolution":{"observed_at":"2026-07-02T11:46:55.636251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:19def89716a09e404c2a64551ed2227408c46f19c4b33a351f2e8d28e2d68d54","observation_id":"20b7a120-a796-479a-8510-223bb3597978","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:2a36082b9a9ffff1b0ce4c772b11a049819b2a97b464ba68b0dd13fa9c5d025d","observation_id":"71c96f1d-84ed-4942-bf21-aa3d4d9f4c95","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"TALL: Temporal activity localization via language query","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c5017fea2d3856b85d0517c4a55f31c5edf9c5aa4244ff0a67045168a9899cf8","observation_id":"2dd58261-06c7-43f7-8ef2-c927534e9c04","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:d10a50f165027d943c785d017c5c70c63572c66a29bb872a112fd17fd57d1930","observation_id":"37f4d66c-d488-4476-98a5-0350c8a2f7ca","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c6f626fb18c06ea8d3c4a695b47aa2441940e6ff5fc8ce2fc5829dc0b9896289","observation_id":"574c89ba-5672-4fff-9c3d-3b004d70f5f5","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Lora: Low-rank adaptation of large language models.Iclr, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5f25c4ca518c2d76cbaf23b77180a69db5e663921da60d19482bd7b1fc5d2f68","observation_id":"51e06bdb-d2c9-447d-8612-64500553faeb","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"VTimeLLM: Empower LLM to grasp video moments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:00e1d4558087a9e8972ba33e311a2aa9bab9b5a8c43865035cfc4d05f38e8b89","observation_id":"b2a3ab53-3dfc-45a8-ad00-215c2cf06940","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:0c083960e9de9620b1e548ddcab8e1d8e61fd2b31be127df714cab577b7516e9","observation_id":"b1ca992f-2d90-4deb-bce3-73f44f9ed9e4","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:ffaebd8308fc7bd88d2b5284b96d71b98c4d898e3b3dbec4ead14309f61971fc","observation_id":"cfee4243-3740-4c21-ba9e-0c2c1f25203c","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Language-free training for zero-shot video grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:955f6b362b3bf043c11326c17223c113bbdd1a34eac3d63c7ddaaf5dea107140","observation_id":"7dae655b-af99-4981-8e5e-be67ccb24be7","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:41d05dd791a321c240de7ae6079d1bafe717410ab0dabb643de8163695506c34","observation_id":"a42c444d-2c8b-4c6f-b415-0e74a11f4f7b","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Dense- captioning events in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:306f2fc29ff96962e8301eda5a5821a99af72b785debadfa4050da2382240fed","observation_id":"0dfa550c-87e6-4a06-b4f2-fa3e4e705ec5","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:0bdac87bec639e9cbb84248cf1acc2633d6ddcc464564a67e911f0238648bacc","observation_id":"0df7b436-0101-47c3-8394-4f12fb37bf14","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:307a29fc64a57e35fa84580d0503e581b18d5fee7a3febce50c4a374f8d193e0","observation_id":"22c7016f-6232-4ada-a241-944be645b0ef","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.13720","last_updated":"2026-01-07T05:36:57Z","snapshot_observed_at":"2026-07-06T22:36:08.495952Z","submitted_at":"2025-11-17T18:59:57Z","title":"Back to Basics: Let Denoising Generative Models Denoise","version":2},"cited_work":{"arxiv_id":"2511.13720","doi":"10.48550/arxiv.2511.13720","metadata_source":"pith","pith_arxiv_id":"2511.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Back to Basics: Let Denoising Generative Models Denoise","venue":"cs.CV","work_id":"37973de8-a5e6-4d92-897b-a98fa9f7f2f3","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2511.13720","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5ec2e48b0a12951d34f41b05fcb43286a036152614f0e35ad8950d27396a7a93","observation_id":"791f67d9-2455-404c-a022-f47cc7db2edc","resolution":{"observed_at":"2026-07-02T11:46:55.642747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:d05ed61b639f0a13c9b251040ba077bb51ecc2c92d180ba88dd6c3b51a563174","observation_id":"8f659ae9-0f3c-4e94-ab1e-499bcadc089f","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"UniVTG: Towards unified video-language temporal grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:9f1c7a5a3e8f5264f2287c8ca80734476e25ca2b30e9a9dbf85e2be4f0c31fbf","observation_id":"f411fe3c-e914-4462-91ca-471357330ada","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:d3fbbd43c9c775c6d06977109e5fdcdca3fa8007192c1acbdf398005b4609f81","observation_id":"5cbceac8-27eb-4801-827c-92fcd496913a","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:0e55830bdbba93d93c1095688975c688c95f3268397a1e2a7f23f89bd12019fc","observation_id":"17628147-70c9-47f9-a981-2470f4ee4642","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:dd139d36457769fd8607dc974a6a4c0e4ca66668839ac687dadb715b79733098","observation_id":"3e6e92c4-34f9-4f93-9cde-913d6c952b3f","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:009dd18ddc41959f9ca580f8a4528c0c0382356081d8d12ce3e29003d67a251c","observation_id":"ca1229c5-4588-4b09-bace-39d432ba5e56","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9334.36454","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:46:55.649690Z","title":"Unitime: A language-empowered unified model for cross-domain time series forecasting","venue":null,"work_id":"af630757-f64b-4104-a20d-44e708ad2221","year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:73654f31aeee73e3271786547c4bf8c4cebcfc1128bd6eb5288e7a3a5d567973","observation_id":"32c98f78-c653-43c9-80e5-7a6b4cd2a1f3","resolution":{"observed_at":"2026-07-02T11:46:55.651527Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:81342269958b201c1009eb70725e9135e67e2ecfb176c8e409c113d68ea4dc78","observation_id":"daf17f2c-62f8-4cae-b998-d210a1bc9d71","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:4f9796701d977343368d0a34aba03bf820879b01e7cfb3bd307d6dd93cfcce96","observation_id":"798a8ea7-e220-42e8-85a8-2d3428905f9f","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3796716","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Valley: Video assistant with large language model enhanced ability","venue":"ACM Transactions on Multimedia Computing Communications and Applications","work_id":"7ab8c8cb-907d-4aa8-abb0-d79c1af37a20","year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:9c22082830cb0ead18668b264cb06cd657f236b82f07176d41278afe6102da77","observation_id":"144ab426-3db2-4f17-9c66-88a0b4c00fa4","resolution":{"observed_at":"2026-06-28T03:11:30.318499Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Video-ChatGPT: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:d21aa86d1c3c3d597b3b162b074e0adc373c52a4cb97aa996fbee8547eb7ad8f","observation_id":"cd70a692-d87c-447b-bc15-900ed1a3a118","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:4aa100be1a797a2737a7e17a872ae6ae59ee638572b1040d24b64075f0825bf6","observation_id":"f39d479a-2aec-48df-9392-2455b6a3d960","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Trespassing the boundaries: Labeling temporal bounds for object interactions in egocentric video","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5da74b9c635c736ab138e56a7ff86281ec04a8fbe4a6425a5bf225e9e27d496a","observation_id":"41069113-3eaf-46a5-b9d6-c279929d4e8e","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Snag: Scalable and accurate video grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:ea8d364983c46966a9be4634856e502539730a13d42d8bbed421264012445c0a","observation_id":"97aee435-53ad-4367-8f5a-8f8ab25b32e5","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Zero-shot natural language video localization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:e83cd80720f40abb1ef67a6aa0a48d48bcf69f518cf8cca2577fbfaec9476ae4","observation_id":"fde93205-503a-4f94-8d15-1eac75398095","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Henriques, Yang Liu, Andrew Zisserman, and Samuel Albanie","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:93d324fcb4152ecca1a567ed779e794e03244bd5b7c7ede988c76918d92f338a","observation_id":"c1ddca02-e7af-4671-aa2f-b63e6d1b100d","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models: Open x-embodiment collaboration 0","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:722b26cf41aaf3bf4cd3eeab0c2f6c0c93373645729b13db7bab7ae5b9adcc66","observation_id":"c03464e7-fb9a-4817-9621-e3248787f36b","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:1d11b707a0cd296d8fec3f241d64c6e1cb2d087784ce717a72873a0ef35e757c","observation_id":"3ca90936-b3f9-47a2-a756-0b2f8201f8e7","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":"2410.13720","doi":"10.48550/arxiv.2410.13720","metadata_source":"pith","pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Movie Gen: A Cast of Media Foundation Models","venue":"cs.CV","work_id":"a6a118b0-002f-4b19-881f-7f1183e0d7d8","year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:baae8fd544c87604598e34a99ac050506e8d88e4c53c52a83e7aa41f5a8094e7","observation_id":"b808d883-fc05-4375-960c-89a75d39fd09","resolution":{"observed_at":"2026-07-02T11:46:55.631004Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Enrich and detect: Video temporal grounding with multimodal LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:e890c54135e04ed799bfe6c34aca15b764d708d1488896f7ac1d2d10e06e47dd","observation_id":"95c57808-42c6-4aab-b54d-fcae42e2414c","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Momentor: Advancing video large language model with fine-grained temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c641be054e85ccce1a549bddf56c45eaf44efe1c7ccbb2ea452724cc01044a5e","observation_id":"97057a09-647f-4a5a-8e9b-d28f0394a72a","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Chatvtg: Video temporal grounding via chat with video dialogue large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:187fd4454bb3628dc0b0d4dddbe21edf5c126a687c29fcfc3e2e72440bb411aa","observation_id":"f7215a9a-bee1-4df8-a38e-97cbf0ada2f2","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"TimeChat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:faabe66edb87e6b3dcc28664de96e2dc221bfc3a56d7665f621bf3ad45e2bd40","observation_id":"6cc68753-7076-4d98-b28c-40f8ed9f5351","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:d431e436a1a4ced7b447977c3af97791786e7a7e032545649ae4fc971c97c0fe","observation_id":"1caf53bf-d45b-45cd-ad5a-d2ab1025957c","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Hollywood in homes: Crowdsourcing data collection for activity understanding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:7167f0ac3b17ecda9435138d2868a3b4d7ab7d18ebe37b93e037917f78f9fc45","observation_id":"012bd99f-ca27-4811-a4da-e8f0aa6c523f","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Score-based generative modeling through stochastic differential equations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:b4fe78c295aead196d7aca257af609e5dcc21acfefe0622557fab6b0cf27c8ee","observation_id":"e2297b42-08f2-4f5c-9911-38ce6827710f","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Moment quantization for video temporal grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5c188d475ac85e5c4f5bbfd5a1886a7c95076e56b94da060b5dff29367433bc6","observation_id":"2b9516eb-9718-4fec-85e3-347a492617d4","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:fb8982faed2c361155ada8bac127dd32a93851ebb59c5250d0f6e63cdd84dd5b","observation_id":"61d34f0c-a5b5-47d7-9b1a-49af527c4358","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5ccd958b5c0fe1acf7e462e42e96e9e0175444b780ea23f451730c763e52135e","observation_id":"5c26f7c0-931a-4256-8799-d8d0f9e8eb9a","resolution":{"observed_at":"2026-07-02T11:46:55.663465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00849","last_updated":"2024-01-01T18:58:42Z","snapshot_observed_at":"2026-07-06T17:10:36.020497Z","submitted_at":"2024-01-01T18:58:42Z","title":"COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training","version":1},"cited_work":{"arxiv_id":"2401.00849","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.00849","snapshot_observed_at":"2026-07-03T10:48:03.218386Z","title":"Cosmo: Contrastive streamlined multi- modal model with interleaved pre-training","venue":null,"work_id":"062bd9dc-7e0a-4991-8029-5fafc4c71e80","year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2401.00849","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:76fc911c09ad12169c4a72dcf9edd24f4043691bd9e73f8b79cf0f04d93d7a86","observation_id":"499609a7-c8ef-4e56-817a-0679e2ae38f6","resolution":{"observed_at":"2026-07-02T11:46:55.666603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:9b23214b5d88999a3043aeb385e4cc1710df0b2c8b7346e93f8eb89616016766","observation_id":"2b4ef27c-3f60-4165-ae80-ced4a3e76709","resolution":{"observed_at":"2026-07-02T11:46:55.669598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c2df1ecb1a3a5ac283240b8647784334044c1cce744fe901c1ead748b9cf54ea","observation_id":"815b454e-b518-40fb-b2f0-9ca95622d5ac","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Vla-adapter: An effective paradigm for tiny-scale vision-language-action model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:74fba0251bf622e07361eaa6b4b56da04aecf064c974f2fcb050ad84909aab84","observation_id":"737b8a5d-8c30-4bc3-9818-ba8fe654a9b6","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10228","last_updated":"2024-03-15T11:58:18Z","snapshot_observed_at":"2026-08-11T14:34:48.261778Z","submitted_at":"2024-03-15T11:58:18Z","title":"HawkEye: Training Video-Text LLMs for Grounding Text in Videos","version":1},"cited_work":{"arxiv_id":"2403.10228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.10228","snapshot_observed_at":"2026-07-03T20:38:56.195732Z","title":"arXiv preprint arXiv:2403.10228 , year=","venue":null,"work_id":"fb2ec1aa-a3b0-43e2-9e93-2b73d3097074","year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2403.10228","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:545dae5c0b266132fa5c166b9a16489d96d324290acf6c2a9a197c5c5f1d62ce","observation_id":"b4438bce-39e3-4a81-88d8-8fcb2c7a5e47","resolution":{"observed_at":"2026-07-02T11:46:55.672672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Towards visual grounding: A survey.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:34f29b98f4f97032706145c0a1446a78adb73d1566e6230dd488a02c48efa94e","observation_id":"f614ba8c-3bb3-4bad-befb-d39b9cd4c338","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c3362a5d3e4a30afb4f071b5075052fbcb8e7955ba7dc6961137a9b893e3af12","observation_id":"fd1a0dff-cd6c-42ed-9153-a053061bc930","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Vlaser: Vision-language-action model with synergistic embodied reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:1e57d646dc6e10d212652bb61539224295d8f86274b10f5bd1f812ceb7c80821","observation_id":"8993a40a-b4e5-44ee-b1d1-47d6c70e7627","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:1c99e48fde6e846ab44e4230affcd686460f2256cdfbfaed4f56437c259381ef","observation_id":"e391880d-6be2-4892-b3f3-568f793cf3f4","resolution":{"observed_at":"2026-07-02T11:46:55.654698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Modeling context in referring expressions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:ab372235b1632e4716bc423ca24fb2ead4070109d3c8e58ad21cc757aa77df5c","observation_id":"6837e88c-06f0-44dd-942d-02228bcc87f7","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Self-chained image-language model for video localization and question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:c7d9f60d7313a3a3ccd62049c720c42c59d9462399660f007b3c11f1fc69c3b6","observation_id":"6d08aa57-362b-4f3e-8a93-5c3cf1e774d8","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":"2603.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-10T18:47:31.580281Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","venue":"cs.CV","work_id":"772d0226-9ad6-42c0-9c79-d36d37edbbe4","year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:4e52d2906104fd76bec016c24a231cd28f016245533d7b1f1b867917e93afa13","observation_id":"e7367b85-f001-45c6-9f7e-acf84312fb1f","resolution":{"observed_at":"2026-07-02T11:46:55.660321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:14b31622b055bb677cccf94425a1d2fd4284ce616175fbdb0e6250593b0030f8","observation_id":"e034433b-9690-4454-93e8-c8ec5b1434de","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Hierarchical video-moment retrieval and step-captioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:6c45d831b41bc56e0205c8eb3a70f706f6dfd2b71af88c3589d6d2c88b5ed02a","observation_id":"2b277255-8762-4f73-a6bd-91c2fae93455","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:68172fba94b15557b5e6a9dce832da45f4266c28f7b83c44cf868e8b4b87eb41","observation_id":"5408c1d3-ca35-48bc-b506-83cf769e3b7a","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"VLM4VLA: Revis- iting vision-language-models in vision-language-action models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:5f3882b8da85726d4de2b51efbe16025f0b41ccae8c8a7d6aa5c886a250fbe6e","observation_id":"8e3979c6-1517-4f9f-9dfb-ed7d09fa703d","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.14698","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:17:29.020428Z","title":"arXiv preprint arXiv:2512.14698 , year=","venue":null,"work_id":"7e995230-85aa-4b56-84dd-314b7ee46b29","year":2025},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:029f4e4966303d75a9da2119221eafa048894f6b98a7d523c88f972b7a51fc37","observation_id":"772d6add-ffbc-4ca8-8df8-ff7cedae1b29","resolution":{"observed_at":"2026-07-02T11:46:55.657654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"(Br +B h)Rn(H) + (Br +B h)2 r log(2/δ) n # . (13) Furthermore, sincew(t)≥1, R(0)− R( ˆh)≥E ∥m(X)∥ 2 2 −App H −Cτ −2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:2c2c47418b25b3b7c7ea9dd1f5a1c28585f9cb6b9adf0ddd536aa2881b4c28d9","observation_id":"290e7c1c-aa05-40ec-9f58-290336248b9a","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"16 For fixed (r, t), the map u7→ϕ r,t(u) =w(t)∥u−r∥ 2 2 is Lipschitz in u with constant at most 2τ −2(Bh +B r)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:3bb5038f750f0a1f11274b2513a0a36ab4e129230a46b80684c5c2fe8ee9ecc3","observation_id":"c77c1107-59b9-4782-8bd7-99799bcbe3a0","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"Decomposing the right-hand side: L(ˆh)− L(m) = L(ˆh)− L(h ⋆ H) + L(h⋆ H)− L(m) = L(ˆh)− L(h ⋆ H) + AppH","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:9085e584c3b69b7078f14b6682575235688be23e4c4506652ab0dc8fd055b381","observation_id":"cec65d27-60e5-46d8-af3b-1d290597ae96","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"17 Conversely, for any full-target predictor H, define hH(X)≜H( ˜X)−g(z) , where ˜X= (y t −(1− t)g(z), t, z)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:e9cf9dff2666cd6144bc553ba423f7542648a06c9096ecd0013ec6250526b3b5","observation_id":"455d2768-f2aa-4e32-bd24-b910a975abfb","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:3c5286865fe6ce49c3ab14e99ec06587ff2b8f40cdb448a50a8b114e8d6b78bc","observation_id":"e83daf3e-1dd1-469e-9fd0-68cc1af1a474","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:83a5224d09e05bce8029639044d5cc9ced706e57b4840740405f65024628bb16","observation_id":"2eb9235e-6bc1-4216-b3ff-b7c09a34c83a","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:1df9702c1caa104b0d8ceb359901995f49901074d3704c8af3f0633db1370ba7","observation_id":"0fc261e5-7b80-41a7-9437-cac0c5df0471","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:f36c231f984f48ad328b8f2559c01babfa6ec38ad9fde7fbf0cd95d94cfd22b5","observation_id":"fcbb69e3-ce2e-4d11-a366-db4e54a5d4ba","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T03:03:23.071178Z","title":"LinearLinearLinear noise𝑡z! Self-Attention+𝑦Linear Sampler 𝑦!mix Base Predictor MLPTokenizerOr z! z! 𝑦","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T03:03:23.071178Z"},"links":{"citing_paper":"/paper/2606.05758"},"observation_digest":"sha256:66679218b21d7982f3de1d9a453c2a81697ca2eaf85ebac88994b1c24a3cf330","observation_id":"f9215499-1e1d-4692-8c83-66965cac3320","resolution":{"observed_at":"2026-06-28T03:03:23.071178Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.05758","last_updated":"2026-06-04T06:37:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T06:37:10Z","title":"DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":15,"verified_fuzzy":0},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2606.05758."}