{"as_of":"2026-08-11T05:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c41970bc31d126008e02db7682dfe5e6609c27cdf273df0a25645b1ad549745e","coverage":[{"denominator":94,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":94,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T07:08:35.946669Z","state":"measured"},{"denominator":194,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":194,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":173,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:57:40.232042Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T19:55:26.333923Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2406.04264"},"observation_digest":"sha256:07bea3ccfa1069ffae521da6403b434b967b2645bf4a54c373b48ed560ef34b0","observation_id":"1251f619-4ad9-4d84-8eba-de96e809bfcb","resolution":{"observed_at":"2026-05-14T19:55:26.496537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":175,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:618b4b529a70495e25e0bae9be7cb6283a8cbf57b81fda7635697d06e21b4d30","observation_id":"3929cb71-7217-45bb-9bbc-5cb5361efda5","resolution":{"observed_at":"2026-05-17T10:46:28.873209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"reference_index":163,"source":"pdf_text","source_observed_at":"2026-05-10T14:23:49.412830Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2408.03326"},"observation_digest":"sha256:84116ebcc63b49586a5591336c4616ac184f519b53d995956bc732bd7035f36e","observation_id":"2a30ea10-0ddd-4fa5-8371-e8240ea9ff57","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"reference_index":156,"source":"arxiv_source","source_observed_at":"2026-05-10T23:20:32.330351Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2410.02713"},"observation_digest":"sha256:db0e85bb4e1cb3fb15b8038c13b5dfd5938644bbdac1079957eccdddc9723512","observation_id":"1194b3af-a1bb-45c0-a5a6-b9f2c4766120","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:53:33.585035Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2410.17434"},"observation_digest":"sha256:5961cff495612982dd1822bacf36384923404a1c2723b5804c63503617a72ee2","observation_id":"69c4ae92-980c-4438-bcce-fa92c87cbe02","resolution":{"observed_at":"2026-05-16T13:53:33.635949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-22T09:27:43.919941Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2412.14171"},"observation_digest":"sha256:f5e27b1fee38cf496f6d0f7c2d6f0423004a6fe1c9960f9f1d4e273ad78045b6","observation_id":"e9fb2502-0eb6-4e15-a7ff-d8cb773cf645","resolution":{"observed_at":"2026-05-22T09:27:44.064590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T04:02:43.261543Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.00574"},"observation_digest":"sha256:692d27e7bc51f8d026649f049074288d62e9a58053d7d69f67c099b8e6e07a5f","observation_id":"e272bae0-47ed-44e8-9638-54b01db80967","resolution":{"observed_at":"2026-05-18T04:02:43.616047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T22:57:40.232042Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-11T01:33:05.827241Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:57:40.232042Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.00584"},"observation_digest":"sha256:971814735031f17c8af41ad2f47f48138fcf849f706e10ca2b9f3e86621126dd","observation_id":"1d0859dd-9a8e-4160-865c-1f35042ff9c3","resolution":{"observed_at":"2026-08-10T22:57:40.232042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T22:52:30.347198Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00599","last_updated":"2025-03-25T08:10:15Z","snapshot_observed_at":"2026-08-10T22:44:44.746913Z","submitted_at":"2024-12-31T18:56:46Z","title":"VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:52:30.347198Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.00599"},"observation_digest":"sha256:69a5e18d0db98ea338770bfac433b8fbe60fdffcf1d74c9b155121f043554260","observation_id":"fa6abe33-b726-44dc-a3f6-008cf740de43","resolution":{"observed_at":"2026-08-10T22:52:30.347198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T22:27:56.460436Z","title":"Long context transfer from language to vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01645","last_updated":"2025-05-13T06:38:44Z","snapshot_observed_at":"2026-08-10T23:44:47.423609Z","submitted_at":"2025-01-03T05:32:37Z","title":"HLV-1K: A Large-scale Hour-Long Video Benchmark for Time-Specific Long Video Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:56.460436Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.01645"},"observation_digest":"sha256:0c6388dfb785b5593f324eb4c11839c56f6c015744c262a4500c1dded9c560a3","observation_id":"c0790486-e797-4a9b-a1d8-d0c314216d93","resolution":{"observed_at":"2026-08-10T22:27:56.460436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:790781ef7cdf484706787228699f47b3a744232bcbc4df9e90349957bdaaea54","observation_id":"85cd279f-e32d-49ea-bb59-543be1c4b444","resolution":{"observed_at":"2026-05-17T21:08:19.641181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T21:23:58.059208Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05037","last_updated":"2025-03-27T09:39:11Z","snapshot_observed_at":"2026-08-10T21:17:52.245219Z","submitted_at":"2025-01-09T07:51:14Z","title":"LongViTU: Instruction Tuning for Long-Form Video Understanding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:58.059208Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.05037"},"observation_digest":"sha256:162c19ff47a5e8111b4cada643f0690b8e81000415274742c6344ac36afa3abd","observation_id":"5e4720b0-756f-4074-a3ec-614e11c3be19","resolution":{"observed_at":"2026-08-10T21:23:58.059208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:8bb8fec451d107014292796038c3dfc3ab1b2c1f6352fec4158eea2a5ec8bb1b","observation_id":"cdfd847a-ef76-48f1-a66e-f25636e27b09","resolution":{"observed_at":"2026-05-23T06:02:37.639944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T16:52:49.916097Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.12766","last_updated":"2025-05-26T04:01:12Z","snapshot_observed_at":"2026-08-10T18:05:14.207274Z","submitted_at":"2025-01-22T10:01:54Z","title":"NExtLong: Toward Effective Long-Context Training without Long Documents","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-10T16:52:49.916097Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.12766"},"observation_digest":"sha256:1fc49a3f1e549462aee85999bb1f9a3473215d1ae53f3f7c7f4b8c142189725d","observation_id":"c62dc1ae-7bce-4b19-8ef8-a581782e4001","resolution":{"observed_at":"2026-08-10T16:52:49.916097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:133919c6184061dd06bb85074b555d5175e24cbe4ed10fe43f9acd26715184db","observation_id":"987e8f26-1a31-4758-85dc-5e9458ed81d4","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T15:58:24.473539Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13468","last_updated":"2025-01-23T08:33:10Z","snapshot_observed_at":"2026-08-10T15:52:49.177380Z","submitted_at":"2025-01-23T08:33:10Z","title":"Streaming Video Understanding and Multi-round Interaction with Memory-enhanced Knowledge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:58:24.473539Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.13468"},"observation_digest":"sha256:baa9c09fde9c5ee3ecb3dd7aa7af4adba63153e1fc51dffa354206c3e4eb7f74","observation_id":"f5040c62-020c-4353-bab4-32171b018be4","resolution":{"observed_at":"2026-08-10T15:58:24.473539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T00:32:41.059558Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.13826"},"observation_digest":"sha256:40a3c61c2bf7b80b9687566bad50d6810d18e213c9b21c6e74bd8496c1a8edca","observation_id":"c28d9e8e-ea83-486e-a407-c8508b62acbc","resolution":{"observed_at":"2026-05-14T00:32:41.190008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-10T15:35:30.305277Z","title":"Longcontexttransferfromlanguagetovision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13919","last_updated":"2025-09-01T07:50:58Z","snapshot_observed_at":"2026-08-11T01:32:58.320917Z","submitted_at":"2025-01-23T18:58:03Z","title":"Temporal Preference Optimization for Long-Form Video Understanding","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T15:35:30.305277Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.13919"},"observation_digest":"sha256:a13554ee3083686860327f3d7d13c4e30f6dec4bc62878af26ba30470a68b40a","observation_id":"cfb261d3-c08a-4034-8835-35aad62cee14","resolution":{"observed_at":"2026-08-10T15:35:30.305277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-09T21:21:45.820352Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19098","last_updated":"2025-05-19T10:18:07Z","snapshot_observed_at":"2026-08-10T11:57:26.754523Z","submitted_at":"2025-01-31T12:45:46Z","title":"$\\infty$-Video: A Training-Free Approach to Long Video Understanding via Continuous-Time Memory Consolidation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T21:21:45.820352Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2501.19098"},"observation_digest":"sha256:4735b43a887d04554f1da46039999c674ff0daef52006b91e76ec31960e80e3e","observation_id":"ccba3e18-c063-432f-a6f1-204bd7e412ce","resolution":{"observed_at":"2026-08-09T21:21:45.820352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-09T15:04:36.998608Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01549","last_updated":"2025-02-03T17:30:19Z","snapshot_observed_at":"2026-08-09T16:01:36.816495Z","submitted_at":"2025-02-03T17:30:19Z","title":"VideoRAG: Retrieval-Augmented Generation with Extreme Long-Context Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T15:04:36.998608Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2502.01549"},"observation_digest":"sha256:785be8e7a3e807c177a47aebc94dd5485b93ab409c3d2be584c513c6efe8d753","observation_id":"078991f5-1663-4b24-ac01-f52c2f54a09a","resolution":{"observed_at":"2026-08-09T15:04:36.998608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-08T23:26:20.592106Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-09T20:29:20.505084Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T23:26:20.592106Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2502.04144"},"observation_digest":"sha256:81da208f1191b26e29d18d941e340d6ed84c4f2b6687b35b923ffffe854cfeef","observation_id":"e79ee3c6-d068-4c32-9b59-2ac9a81cf4ef","resolution":{"observed_at":"2026-08-08T23:26:20.592106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-08T15:31:16.994358Z","title":"Long con- text transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06428","last_updated":"2025-02-11T14:59:25Z","snapshot_observed_at":"2026-08-11T01:32:36.892918Z","submitted_at":"2025-02-10T13:03:05Z","title":"CoS: Chain-of-Shot Prompting for Long Video Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:31:16.994358Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2502.06428"},"observation_digest":"sha256:dbd92d67011708b9b0567e6aacca73f9b58f3b4c9f1527997be80137f9196aeb","observation_id":"d38a661a-07d0-4337-94fe-949196180adb","resolution":{"observed_at":"2026-08-08T15:31:16.994358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-08T13:02:23.640079Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07365","last_updated":"2025-05-28T08:04:23Z","snapshot_observed_at":"2026-08-09T03:30:26.149584Z","submitted_at":"2025-02-11T08:37:16Z","title":"LongReD: Mitigating Short-Text Degradation of Long-Context Large Language Models via Restoration Distillation","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-08T13:02:23.640079Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2502.07365"},"observation_digest":"sha256:2e4262657d5765a35e69ec458b2328b3ffae359cd6f74edda09ed7d1d9d02082","observation_id":"5facfe1c-fbc9-40fe-938b-35110551efa7","resolution":{"observed_at":"2026-08-08T13:02:23.640079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T09:43:00.208065Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2503.21776"},"observation_digest":"sha256:95b8bbf8aba5aa8d1c33981a425dcb4a863cba148f5e56762d68d18ffe973ebb","observation_id":"e99c838d-a56e-425e-8168-ddef02a2589a","resolution":{"observed_at":"2026-05-12T09:43:00.307194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:ac466627bab026bebd2b501ecac66d6fc73a90221087defb984cf5b2147fc0c5","observation_id":"ada76126-f8e5-4621-8c0b-fd110515a6dd","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:34:40.769437Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14640","last_updated":"2025-05-20T17:26:32Z","snapshot_observed_at":"2026-08-10T08:26:12.719387Z","submitted_at":"2025-05-20T17:26:32Z","title":"VideoEval-Pro: Robust and Realistic Long Video Understanding Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:34:40.769437Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.14640"},"observation_digest":"sha256:57cfae8ad7a9949a58faf874ffd5ec14b6d2a11e31eea9e81519ad3fc72626c4","observation_id":"fbb17e75-ffea-475a-947c-10ab364bd87b","resolution":{"observed_at":"2026-08-07T15:34:40.769437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:20:59.552615Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15447","last_updated":"2025-05-21T12:29:40Z","snapshot_observed_at":"2026-08-11T01:33:01.559626Z","submitted_at":"2025-05-21T12:29:40Z","title":"ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:59.552615Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15447"},"observation_digest":"sha256:db22f33783ff247c6c9d458edd53f097cd2a4592947255173ff9fe576c2047ff","observation_id":"686d382c-f69d-4325-9780-7c48d5248f4d","resolution":{"observed_at":"2026-08-07T15:20:59.552615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:20:48.560323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15529","last_updated":"2025-05-21T13:52:17Z","snapshot_observed_at":"2026-08-09T21:52:59.287019Z","submitted_at":"2025-05-21T13:52:17Z","title":"Clapper: Compact Learning and Video Representation in VLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:20:48.560323Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15529"},"observation_digest":"sha256:d7e3962af686eb70871e379b2d1bf51c1003b0cde95a9da292127a420ffb0ae2","observation_id":"896f522a-1fd3-4c1f-9435-e1462eb735e9","resolution":{"observed_at":"2026-08-07T15:20:48.560323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T15:15:12.258703Z","title":"Long con- text transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-10T16:32:32.120622Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:12.258703Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:0ebce9283074536df277777e16d90cad4e50a888757bee7676288dad165bd39c","observation_id":"c45523ae-bfe6-4356-b6b4-3f7ce6e92d7d","resolution":{"observed_at":"2026-08-07T15:15:12.258703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T14:09:15.746320Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19877","last_updated":"2025-05-26T12:05:16Z","snapshot_observed_at":"2026-08-10T09:10:24.017088Z","submitted_at":"2025-05-26T12:05:16Z","title":"Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:15.746320Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.19877"},"observation_digest":"sha256:7309bd699e8ded63ca7843328c7e296b4ea80decdf19bcea290146a06130ce82","observation_id":"094c0bcc-ac62-41ab-9ccc-b719cc5beb56","resolution":{"observed_at":"2026-08-07T14:09:15.746320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T14:03:05.277632Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-08T09:10:32.146078Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:05.277632Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:20d369f1188c58703916d39b6fc29aba5c76b2c0d381ca17a64c3a00e632141b","observation_id":"2108de4d-6b3d-48a7-8140-aff954899ef2","resolution":{"observed_at":"2026-08-07T14:03:05.277632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:451e1d823ec1ccd84d298e05957a6b9db53e6eafe47ea5d7ea8669cfb699f546","observation_id":"af4007e5-3f71-456d-80e7-b3c04993e6b8","resolution":{"observed_at":"2026-05-16T08:34:36.960131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:d9976af00f6c1b8f31b96902e3d3bd1f6cea5d3c95e12834e14b701c7a94f51f","observation_id":"df459411-a9ef-4025-ba51-db9a32e0e78d","resolution":{"observed_at":"2026-05-22T01:00:51.367097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T12:37:24.093163Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24158","last_updated":"2025-05-30T03:04:28Z","snapshot_observed_at":"2026-08-10T08:26:14.415807Z","submitted_at":"2025-05-30T03:04:28Z","title":"Threading Keyframe with Narratives: MLLMs as Strong Long Video Comprehenders","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:24.093163Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.24158"},"observation_digest":"sha256:ff89157454276407d60c772b6693961c101a22e512f4180a86d6b41154d75c79","observation_id":"d0f16f33-24b5-4af9-ad4e-4b8e07355c6d","resolution":{"observed_at":"2026-08-07T12:37:24.093163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T12:22:13.330350Z","title":"Long context transfer from language to vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24718","last_updated":"2025-06-08T14:43:47Z","snapshot_observed_at":"2026-08-11T01:02:46.296265Z","submitted_at":"2025-05-30T15:42:19Z","title":"Reinforcing Video Reasoning with Focused Thinking","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:22:13.330350Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2505.24718"},"observation_digest":"sha256:85fcefb4ccd1681fea78518324b1c318315b5dc7e9d40e08cd2bffd76788f5f9","observation_id":"708677d5-b6a1-4e7b-88c6-5af249e4da12","resolution":{"observed_at":"2026-08-07T12:22:13.330350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T12:16:16.215765Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-08-09T02:39:20.854550Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-07T12:16:16.215765Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.00123"},"observation_digest":"sha256:4960fcd686ee433e8a3ddf661c5ebc34f3451650460cf395000ce5b0a8e06b0d","observation_id":"0efa8bca-4d4f-4abb-a51f-dcad74ffb272","resolution":{"observed_at":"2026-08-07T12:16:16.215765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:59:10.606703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00993","last_updated":"2025-06-01T12:49:39Z","snapshot_observed_at":"2026-08-08T18:44:33.509277Z","submitted_at":"2025-06-01T12:49:39Z","title":"FlexSelect: Flexible Token Selection for Efficient Long Video Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:59:10.606703Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.00993"},"observation_digest":"sha256:fa97cbf1a3708f94ff20260ca82f2a4cd49235477d2d170bf72262c6d525368d","observation_id":"31892af6-6997-4b2c-9b72-0e9cc0709858","resolution":{"observed_at":"2026-08-07T11:59:10.606703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:51:29.901221Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01274","last_updated":"2026-06-11T17:06:50Z","snapshot_observed_at":"2026-08-10T04:03:56.011290Z","submitted_at":"2025-06-02T03:08:07Z","title":"ReFoCUS: Reinforcement-guided Frame Optimization for Contextual Understanding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:51:29.901221Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.01274"},"observation_digest":"sha256:aeb05ad4df558c161cec9f7e9fc1d4549baad00655b7c486b12231a77381b3e9","observation_id":"8ac67125-e712-4a7e-ac56-d9575d4c0163","resolution":{"observed_at":"2026-08-07T11:51:29.901221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:35:47.916580Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01908","last_updated":"2025-06-02T17:28:26Z","snapshot_observed_at":"2026-08-07T11:29:22.385642Z","submitted_at":"2025-06-02T17:28:26Z","title":"Reinforcement Learning Tuning for VideoLLMs: Reward Design and Data Efficiency","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:47.916580Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.01908"},"observation_digest":"sha256:04a7e050c4db2db9133ed70b7f4bc281507203272564d344a28b4c265077d6a6","observation_id":"cc55fd6e-4219-447b-b325-f6fe6f62535c","resolution":{"observed_at":"2026-08-07T11:35:47.916580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T11:26:43.138721Z","title":"Long con- text transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02555","last_updated":"2025-06-03T07:44:41Z","snapshot_observed_at":"2026-08-11T01:58:14.310541Z","submitted_at":"2025-06-03T07:44:41Z","title":"SurgVLM: A Large Vision-Language Model and Systematic Evaluation Benchmark for Surgical Intelligence","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:43.138721Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.02555"},"observation_digest":"sha256:36230982869e506fff8e94000cc0980c623f7e91b66255979ff8fabe430d56a9","observation_id":"b0a8dfb3-6cc0-40ee-a393-04b366ffd805","resolution":{"observed_at":"2026-08-07T11:26:43.138721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T12:50:06.285354Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03179","last_updated":"2025-05-29T13:17:25Z","snapshot_observed_at":"2026-08-10T21:30:34.921880Z","submitted_at":"2025-05-29T13:17:25Z","title":"Vid-SME: Membership Inference Attacks against Large Video Understanding Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:06.285354Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.03179"},"observation_digest":"sha256:c98e7579c8284efc6021c88b7fb780ff2742baa1f7f2e3f8a004702d78f6843d","observation_id":"7090f9e5-e826-48d2-a982-117d9ec7574c","resolution":{"observed_at":"2026-08-07T12:50:06.285354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:35:18.836228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04983","last_updated":"2025-06-05T12:54:56Z","snapshot_observed_at":"2026-08-08T09:50:26.694274Z","submitted_at":"2025-06-05T12:54:56Z","title":"TextVidBench: A Benchmark for Long Video Scene Text Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:35:18.836228Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.04983"},"observation_digest":"sha256:104cba96acd019456d7075dd6fc0e0892df5426403cc7f1b40ef2aa61ae29e93","observation_id":"b10c4db0-dc68-4031-b0c2-9d98e407ecf4","resolution":{"observed_at":"2026-08-07T10:35:18.836228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:28:51.563326Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05260","last_updated":"2025-06-05T17:21:16Z","snapshot_observed_at":"2026-08-09T11:16:28.299508Z","submitted_at":"2025-06-05T17:21:16Z","title":"LeanPO: Lean Preference Optimization for Likelihood Alignment in Video-LLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:51.563326Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.05260"},"observation_digest":"sha256:b9a367312018a4d22e85e8a7149914c593d24191ae1ee756067a12f913a87810","observation_id":"d56b795a-64cc-4291-86fd-07789b11d2f0","resolution":{"observed_at":"2026-08-07T10:28:51.563326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:29:09.433526Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-09T15:14:29.691315Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.433526Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:ae9dfc8202d710872d914a8aea2567e56dd8bf0db5e798ad95c4c38f52a8494f","observation_id":"f2a45ff1-3772-427d-a662-2d50614b02a3","resolution":{"observed_at":"2026-08-07T10:29:09.433526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T10:25:36.343725Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05349","last_updated":"2025-06-24T07:36:56Z","snapshot_observed_at":"2026-08-07T23:48:12.277994Z","submitted_at":"2025-06-05T17:59:58Z","title":"VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:25:36.343725Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.05349"},"observation_digest":"sha256:0d5c1a72064e2012c747a91f3b13e4398bcb3479ebf89bd8ba8445ffcd919aa3","observation_id":"d35a5bff-efa6-4b40-aa4c-bba752662cc4","resolution":{"observed_at":"2026-08-07T10:25:36.343725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:49:53.408552Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-08T12:14:39.714543Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:53.408552Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07016"},"observation_digest":"sha256:b8935b1b76f047d03b655e2b73733ec2c7d1481ec95f494280bc8ce1cc055c0c","observation_id":"372c0c6c-ddb6-46d8-8879-8a2903415c3f","resolution":{"observed_at":"2026-08-07T05:49:53.408552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T05:26:47.299651Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:47.299651Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:cc26634777f6d6ef7ea7c67cc2fe0a865b300d66f0ec58a1765ceec3badfc52d","observation_id":"cf0663c6-07a0-424d-a475-16f65e101b6b","resolution":{"observed_at":"2026-08-07T05:26:47.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:36:57.778449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10415","last_updated":"2025-06-12T07:12:31Z","snapshot_observed_at":"2026-08-10T07:42:00.940330Z","submitted_at":"2025-06-12T07:12:31Z","title":"Burn After Reading: Do Multimodal Large Language Models Truly Capture Order of Events in Image Sequences?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T04:36:57.778449Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10415"},"observation_digest":"sha256:a9c3b9a2b86dc45972f8bcda651f6f519ad5f2ad1c02c3e7b79566facf410ade","observation_id":"48c77cfe-290f-4270-adb6-2b1adcf3f0d6","resolution":{"observed_at":"2026-08-07T04:36:57.778449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:22:56.105590Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10857","last_updated":"2025-08-04T09:11:48Z","snapshot_observed_at":"2026-08-08T13:30:57.844783Z","submitted_at":"2025-06-12T16:17:17Z","title":"VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T04:22:56.105590Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10857"},"observation_digest":"sha256:68f5309e8864424f398c1aa085f97f85ca6804786917a7ff6060fb6e107b6861","observation_id":"780e01ce-6412-459e-9e7b-5403e03752ce","resolution":{"observed_at":"2026-08-07T04:22:56.105590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T04:20:33.079691Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10967","last_updated":"2025-07-01T08:19:08Z","snapshot_observed_at":"2026-08-08T17:11:06.528222Z","submitted_at":"2025-06-12T17:59:09Z","title":"Beyond Attention or Similarity: Maximizing Conditional Diversity for Token Pruning in MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:33.079691Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.10967"},"observation_digest":"sha256:7a22bdc91ea8d973e50bfb52199c9bdea09e8215f8b516d6514ddc583b7c6e14","observation_id":"26b7f326-3691-4767-a429-eddfeaa91aef","resolution":{"observed_at":"2026-08-07T04:20:33.079691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-07T00:34:38.476955Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13654","last_updated":"2025-06-16T16:17:08Z","snapshot_observed_at":"2026-08-07T12:51:07.988679Z","submitted_at":"2025-06-16T16:17:08Z","title":"Ego-R1: Chain-of-Tool-Thought for Ultra-Long Egocentric Video Reasoning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T00:34:38.476955Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.13654"},"observation_digest":"sha256:646d70d9f4c5a634fe12c677789794f97594e1d235466df9833ce581ac2f84a4","observation_id":"d807b7f7-e6c9-475d-93ee-a9cd1cf256d3","resolution":{"observed_at":"2026-08-07T00:34:38.476955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-12T18:51:15.428692Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.15564"},"observation_digest":"sha256:6602292848dd3b12dedef53cdad3b3e40b645bf2f4db055d5b4fb24cde5d287d","observation_id":"81ae1300-a353-4646-9fc7-5186e7de2a7a","resolution":{"observed_at":"2026-05-12T18:51:15.954923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:48:36.814956Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16141","last_updated":"2025-06-19T08:49:13Z","snapshot_observed_at":"2026-08-08T06:18:41.273900Z","submitted_at":"2025-06-19T08:49:13Z","title":"GRPO-CARE: Consistency-Aware Reinforcement Learning for Multimodal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:48:36.814956Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16141"},"observation_digest":"sha256:72eca2edb8b9c06f7bf3f7918090597bf66713bfa6a5b9ea7cea2d953937dce0","observation_id":"0b8f8ce4-9400-4786-81bd-7c484317d5cc","resolution":{"observed_at":"2026-08-06T23:48:36.814956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:42:13.971332Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16691","last_updated":"2025-06-20T02:25:33Z","snapshot_observed_at":"2026-08-11T00:54:41.191381Z","submitted_at":"2025-06-20T02:25:33Z","title":"LaVi: Efficient Large Vision-Language Models via Internal Feature Modulation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:13.971332Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.16691"},"observation_digest":"sha256:697adcdeef6f0899e3b22196c0789717ce713f72170ec941dc0fa1146325c14c","observation_id":"35bc73c8-054a-4132-919a-d3a9d7e7a3e6","resolution":{"observed_at":"2026-08-06T23:42:13.971332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T23:13:07.042420Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19225","last_updated":"2025-06-24T01:19:56Z","snapshot_observed_at":"2026-08-07T21:07:46.308380Z","submitted_at":"2025-06-24T01:19:56Z","title":"Video-XL-2: Towards Very Long-Video Understanding Through Task-Aware KV Sparsification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:13:07.042420Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.19225"},"observation_digest":"sha256:3d848e974c78f9218197d8c7af124e14a8c9e02f947d9968abb227d30ef41e21","observation_id":"38fdb9fe-d313-4570-8f2b-565d97b42853","resolution":{"observed_at":"2026-08-06T23:13:07.042420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:36:39.426259Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21184","last_updated":"2025-06-26T12:43:43Z","snapshot_observed_at":"2026-08-08T13:40:41.778180Z","submitted_at":"2025-06-26T12:43:43Z","title":"Task-Aware KV Compression For Cost-Effective Long Video Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:39.426259Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.21184"},"observation_digest":"sha256:b8a050cbe0470a07200d1703a1e5aec0324a90e913c93acc5a7721c90b5c3992","observation_id":"122a666a-3a86-4f3c-a925-119f5f0a1358","resolution":{"observed_at":"2026-08-06T22:36:39.426259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:15:04.749344Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22139","last_updated":"2025-07-22T07:42:31Z","snapshot_observed_at":"2026-08-09T21:52:46.816951Z","submitted_at":"2025-06-27T11:30:51Z","title":"Q-Frame: Query-aware Frame Selection and Multi-Resolution Adaptation for Video-LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:15:04.749344Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22139"},"observation_digest":"sha256:73eb103e44d8bef0ebbafaec34a30a839674d24bba771ecec655c0032c29130d","observation_id":"ef8de3d9-0280-4974-bb2f-47853121def6","resolution":{"observed_at":"2026-08-06T22:15:04.749344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T22:10:22.903154Z","title":"Long context transfer from language to vision.arXiv:2406.16852,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22434","last_updated":"2025-06-27T17:59:27Z","snapshot_observed_at":"2026-08-09T16:37:51.559760Z","submitted_at":"2025-06-27T17:59:27Z","title":"MiCo: Multi-image Contrast for Reinforcement Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:10:22.903154Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.22434"},"observation_digest":"sha256:9e104273f1117fc43380ee668d14823b1bda2f6e882ffc3d0d2cfb27f7edb94b","observation_id":"ac77033f-768b-4197-b7c0-04d0923444c2","resolution":{"observed_at":"2026-08-06T22:10:22.903154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T21:37:08.962828Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23825","last_updated":"2025-07-24T07:25:10Z","snapshot_observed_at":"2026-08-10T08:26:14.921423Z","submitted_at":"2025-06-30T13:17:49Z","title":"Flash-VStream: Efficient Real-Time Understanding for Long Video Streams","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:37:08.962828Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2506.23825"},"observation_digest":"sha256:a6e2bec3144f4a7761d6b44d80b43cf38d4bb1522e98da820835e5409050a7da","observation_id":"fafdc095-d006-47ba-8474-889537b0e4ff","resolution":{"observed_at":"2026-08-06T21:37:08.962828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T20:29:56.985190Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02591","last_updated":"2025-07-23T07:25:27Z","snapshot_observed_at":"2026-08-09T23:16:14.999128Z","submitted_at":"2025-07-03T12:55:16Z","title":"AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding","version":3},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-06T20:29:56.985190Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.02591"},"observation_digest":"sha256:0294cf48c2f3c0bd2262a636dda5d83f1d49f9b6d4b0efae7a5030f58d40c604","observation_id":"079be2da-dd1c-462c-b917-a51a2c231eee","resolution":{"observed_at":"2026-08-06T20:29:56.985190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T18:32:50.185274Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07990","last_updated":"2025-07-10T17:59:02Z","snapshot_observed_at":"2026-08-09T00:35:41.482303Z","submitted_at":"2025-07-10T17:59:02Z","title":"Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T18:32:50.185274Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.07990"},"observation_digest":"sha256:ddee5d22538b6de87a96065d9f9d0fedcc82e9e22612cf1a5c20bbef1031a55a","observation_id":"602199ed-14c7-4fbf-9815-939352dc8fa4","resolution":{"observed_at":"2026-08-06T18:32:50.185274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T18:12:25.859396Z","title":"arXiv preprint arXiv:2406.16852 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09097","last_updated":"2025-07-12T00:45:38Z","snapshot_observed_at":"2026-08-09T16:57:55.403326Z","submitted_at":"2025-07-12T00:45:38Z","title":"RadEyeVideo: Enhancing general-domain Large Vision Language Model for chest X-ray analysis with video representations of eye gaze","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:25.859396Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.09097"},"observation_digest":"sha256:bef35882777e97cc8c4b32f67ad23d33affa1174cab7b73ed9be077b27675ae0","observation_id":"6118feca-54de-4a13-896f-92b60e129dd8","resolution":{"observed_at":"2026-08-06T18:12:25.859396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T18:03:14.047880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09313","last_updated":"2025-07-15T11:48:07Z","snapshot_observed_at":"2026-08-09T21:58:49.061689Z","submitted_at":"2025-07-12T15:11:50Z","title":"ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T18:03:14.047880Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.09313"},"observation_digest":"sha256:d8aff36d4415d1bd11f620921e964bc5d3b219f279822f6cf0dba435ff2d6297","observation_id":"009ac0f9-9498-40c2-b9cd-b9a93ba48836","resolution":{"observed_at":"2026-08-06T18:03:14.047880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T15:48:37.124321Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15028","last_updated":"2025-07-20T16:30:33Z","snapshot_observed_at":"2026-08-09T21:07:25.586579Z","submitted_at":"2025-07-20T16:30:33Z","title":"Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:37.124321Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.15028"},"observation_digest":"sha256:f466e3ab15dd4d75cdcee76c8a7fe7fd167cabf05ad7a425191b2ecd0adf8e2c","observation_id":"fe22ba31-6ef0-422e-a89e-4b5188af112e","resolution":{"observed_at":"2026-08-06T15:48:37.124321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T14:05:32.507337Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19821","last_updated":"2025-08-02T13:22:34Z","snapshot_observed_at":"2026-08-10T22:09:58.641713Z","submitted_at":"2025-07-26T06:38:07Z","title":"LAVA: Language Driven Scalable and Versatile Traffic Video Analytics","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T14:05:32.507337Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2507.19821"},"observation_digest":"sha256:a1406732c2e3b295166915766aed1840ebb706bc4f475bed6ec93efd00a09632","observation_id":"3b5e3be6-f9fb-455b-8214-d751b065597f","resolution":{"observed_at":"2026-08-06T14:05:32.507337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-06T00:03:35.312845Z","title":"Long context transfer from lan- guage to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04415","last_updated":"2025-08-06T13:03:16Z","snapshot_observed_at":"2026-08-07T20:42:58.746080Z","submitted_at":"2025-08-06T13:03:16Z","title":"Empowering Nanoscale Connectivity through Molecular Communication: A Case Study of Virus Infection","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T00:03:35.312845Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2508.04415"},"observation_digest":"sha256:b6338d3371b41686116bec96014c043280a217ba1b1f780034d57e3825d7e782","observation_id":"3db7dd76-d71f-41af-b576-3b93ebe9c2ee","resolution":{"observed_at":"2026-08-06T00:03:35.312845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T15:10:16.823023Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20478","last_updated":"2026-05-29T09:48:44Z","snapshot_observed_at":"2026-08-10T18:09:36.145325Z","submitted_at":"2025-08-28T06:55:08Z","title":"Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T15:10:16.823023Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2508.20478"},"observation_digest":"sha256:2aaac804310ada2bbc2f092d763c8fbe88fea21d69b152ac4945a0c9a028050c","observation_id":"defef782-e812-4bf7-8dcb-9fda3c5ddc59","resolution":{"observed_at":"2026-08-05T15:10:16.823023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T13:54:52.799037Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00210","last_updated":"2025-08-29T19:47:25Z","snapshot_observed_at":"2026-08-10T08:26:32.361121Z","submitted_at":"2025-08-29T19:47:25Z","title":"Beyond Pixels: Introducing Geometric-Semantic World Priors for Video-based Embodied Models via Spatio-temporal Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T13:54:52.799037Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2509.00210"},"observation_digest":"sha256:5c8cb73352f034bf35627e30f784dd498707dc6784bd356fecf92ad72da9dd52","observation_id":"217ed845-1e01-4a96-a6ec-079d028f42d4","resolution":{"observed_at":"2026-08-05T13:54:52.799037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-04T19:28:34.150112Z","title":"Long context transfer from language to vision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09263","last_updated":"2025-09-11T08:49:22Z","snapshot_observed_at":"2026-08-11T00:06:42.054152Z","submitted_at":"2025-09-11T08:49:22Z","title":"DATE: Dynamic Absolute Time Enhancement for Long Video Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:34.150112Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2509.09263"},"observation_digest":"sha256:ccaf6e90a20fa98df13e6c87b4617edcd65cfe0d11b7bc7a0df902c0037bfcc7","observation_id":"a75667df-189b-40d5-a2e7-ab369304ba27","resolution":{"observed_at":"2026-08-04T19:28:34.150112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-04T09:12:09.768750Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17045","last_updated":"2026-06-01T07:19:41Z","snapshot_observed_at":"2026-08-04T09:12:02.562884Z","submitted_at":"2025-10-19T23:17:13Z","title":"Video Reasoning without Training","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T09:12:09.768750Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2510.17045"},"observation_digest":"sha256:82e6e285e98cef41fb11badb85d5e56a47187f8e27869e8a4889a670fa585d66","observation_id":"7648395d-473f-4b5d-a0fc-713faf085d21","resolution":{"observed_at":"2026-08-04T09:12:09.768750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-04T07:23:08.764864Z","title":"Long context transfer from language to vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-06T20:27:36.141566Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:08.764864Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:14df041237fc6fb2982df40a61dd25e3d088ef5243c87f56a22b64ff6304aac6","observation_id":"738943dd-7f6f-4f19-83b6-12b008fa9194","resolution":{"observed_at":"2026-08-04T07:23:08.764864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2511.04670","last_updated":"2025-11-06T18:55:17Z","snapshot_observed_at":"2026-07-06T22:35:07.844255Z","submitted_at":"2025-11-06T18:55:17Z","title":"Cambrian-S: Towards Spatial Supersensing in Video","version":1},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-05-18T03:46:04.363500Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2511.04670"},"observation_digest":"sha256:31434ed2c672f491d47880c6f23d2ae99af412da6762a974535a7892a7ffa236","observation_id":"d4504deb-bbe8-4d43-bf54-8eddaaf3a9c8","resolution":{"observed_at":"2026-05-18T03:46:04.694927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-08-09T22:36:48.890275Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-17T22:24:41.760120Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2511.11113"},"observation_digest":"sha256:fa8375fd718856c981542fa971b0531f34a82af98b5e0d2faa579ff28d81b71b","observation_id":"b6d85b97-3627-4be6-b44e-c209e842c7f1","resolution":{"observed_at":"2026-05-17T22:25:22.580751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2511.13026","last_updated":"2026-05-14T09:07:42Z","snapshot_observed_at":"2026-08-08T16:39:03.225299Z","submitted_at":"2025-11-17T06:25:12Z","title":"REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T22:19:36.366837Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2511.13026"},"observation_digest":"sha256:dbd7237b6222b8d5bac646a76f9c6f42975a2a1832c4acb29cb8e8e8876ca303","observation_id":"5d0bb3f1-e85d-4ecf-bb20-9a521d582944","resolution":{"observed_at":"2026-05-17T22:20:22.866300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-03T20:15:36.972775Z","title":"Long context transfer from language to vision.arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-09T00:51:01.709796Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:36.972775Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:c20d76ca81d2f695780d6c113e0e91710642e99d6cf81103448e4675c9c0b58d","observation_id":"7b972113-b370-45c8-9b32-5690607e6a70","resolution":{"observed_at":"2026-08-03T20:15:36.972775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-03T18:22:32.646227Z","title":"Long context transfer from language to vision.arXiv preprint arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05774","last_updated":"2026-06-04T07:27:00Z","snapshot_observed_at":"2026-08-03T18:22:22.611333Z","submitted_at":"2025-12-05T15:03:48Z","title":"Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T18:22:32.646227Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2512.05774"},"observation_digest":"sha256:29b4c67593163c667325a2ab822d5921dea0274ca303ebe82c4790bfeebba388","observation_id":"82e609f1-d849-4451-89ca-dde64e8fbb9e","resolution":{"observed_at":"2026-08-03T18:22:32.646227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2512.08410","last_updated":"2026-04-09T06:44:08Z","snapshot_observed_at":"2026-08-10T21:26:08.856126Z","submitted_at":"2025-12-09T09:40:20Z","title":"Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T00:10:01.596422Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2512.08410"},"observation_digest":"sha256:2d5bf63e73e03618487d0785cdbe869b86bf26a4002edfa18a325e2ada6332ce","observation_id":"f964a623-93b3-404c-b769-131bde129cf3","resolution":{"observed_at":"2026-05-17T00:11:23.285697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2512.23365","last_updated":"2026-04-09T12:09:38Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T10:48:54Z","title":"SpatialMosaic: A Multiview VLM Dataset for Partial Visibility","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T19:42:25.626448Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2512.23365"},"observation_digest":"sha256:7e8cc9b5b1e569d2daa0f1cf5d48365776ed1ba8ab96c1bcbad2ca2050c88bc7","observation_id":"ed169029-a8de-464c-8137-bea9c7cca2a2","resolution":{"observed_at":"2026-05-16T19:43:20.648500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2601.14724","last_updated":"2026-05-07T12:10:26Z","snapshot_observed_at":"2026-08-05T03:02:47.238051Z","submitted_at":"2026-01-21T07:26:15Z","title":"HERMES: KV Cache as Hierarchical Memory for Efficient Streaming Video Understanding","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T12:55:04.564442Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2601.14724"},"observation_digest":"sha256:34b98e45ab23bd5c551140ca8a4425b9396d1291d61a81b8dc8cf1e5aaa92e78","observation_id":"ff464fde-2c93-413f-85b0-02642e352f9f","resolution":{"observed_at":"2026-05-16T12:57:53.860496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-03T06:50:29.849129Z","title":"Long context transfer from language to vision.ArXiv, abs/2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22054","last_updated":"2026-07-03T08:31:57Z","snapshot_observed_at":"2026-08-09T15:24:18.311822Z","submitted_at":"2026-01-29T17:52:41Z","title":"MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources","version":2},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-08-03T06:50:29.849129Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2601.22054"},"observation_digest":"sha256:741424cd88181ec5c511ec482c99c63e35fc1172e465fd5728ddc52823e221f4","observation_id":"334625a9-0400-42c3-8049-4db0e5b16ca5","resolution":{"observed_at":"2026-08-03T06:50:29.849129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T19:58:28.912117Z","title":"Long context transfer from language to vision.arXiv:2406.16852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00461","last_updated":"2026-06-10T06:57:00Z","snapshot_observed_at":"2026-08-05T02:58:46.928689Z","submitted_at":"2026-02-28T04:42:34Z","title":"ReMoT: Reinforcement Learning with Motion Contrast Triplets","version":3},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-08-02T19:58:28.912117Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.00461"},"observation_digest":"sha256:d42fc9b2fc295dedecd142fc469f6b27c6603e773e67282d6b118d05f758618c","observation_id":"4780408a-6c60-4b1f-b636-5a1de8a8f82d","resolution":{"observed_at":"2026-08-02T19:58:28.912117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2603.01455","last_updated":"2026-04-21T05:06:35Z","snapshot_observed_at":"2026-08-10T21:56:37.654289Z","submitted_at":"2026-03-02T05:12:45Z","title":"From Verbatim to Gist: Distilling Pyramidal Multimodal Memory via Semantic Information Bottleneck for Long-Horizon Video Agents","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T18:09:59.236030Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.01455"},"observation_digest":"sha256:5aef3746a6d17527c927b53212030337ba72a3335ae3be313609c8322eb7fca6","observation_id":"1862eb9f-6e6d-4eac-9e5b-43713013f906","resolution":{"observed_at":"2026-05-15T18:10:13.040656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-07-14T00:15:23.806078Z","title":"action af- fordance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.15600","last_updated":"2026-07-07T09:37:35Z","snapshot_observed_at":"2026-08-08T09:36:15.764198Z","submitted_at":"2026-03-16T17:53:28Z","title":"From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T00:15:23.806078Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.15600"},"observation_digest":"sha256:a6ed766e268e1b53d88fa7d41565311a79c97676fec66fbe624e1716d2401aec","observation_id":"79630530-51c6-4ae5-b6c6-df80086870f8","resolution":{"observed_at":"2026-07-14T00:15:23.806078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-02T17:54:09.705716Z","title":"arXiv preprint arXiv:2406.16852 (2024) 11","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.19235","last_updated":"2026-07-17T06:42:00Z","snapshot_observed_at":"2026-08-10T00:39:51.221084Z","submitted_at":"2026-03-19T17:59:58Z","title":"Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T17:54:09.705716Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.19235"},"observation_digest":"sha256:1560d30deca5ed6a174a89cc6ffc4fe1a71cb92d1370e9e630d3f8fcfd843993","observation_id":"e7d8a661-922b-44cd-81cc-fdea29c5d0af","resolution":{"observed_at":"2026-08-02T17:54:09.705716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2603.27259","last_updated":"2026-06-18T21:01:40Z","snapshot_observed_at":"2026-08-02T11:52:58.572026Z","submitted_at":"2026-03-28T12:44:19Z","title":"Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-14T22:05:07.326202Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2603.27259"},"observation_digest":"sha256:a97a6fec723d581cecfa20891c5fab5f5b2f5dd4c24d5f176878d50359071a76","observation_id":"7b78802e-815f-412f-89dc-f2e33e3ba61a","resolution":{"observed_at":"2026-05-14T22:08:04.465877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.01824","last_updated":"2026-05-10T14:15:29Z","snapshot_observed_at":"2026-07-06T22:51:40.181565Z","submitted_at":"2026-04-02T09:35:27Z","title":"STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T21:12:29.596207Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.01824"},"observation_digest":"sha256:9b06404e974502f0361b8e40c9bd87cb72929ac36fd3f21a7002bdc430d13836","observation_id":"bf500279-c1a0-4dad-b808-c81cae10a01d","resolution":{"observed_at":"2026-05-13T21:13:16.342523Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.05695","last_updated":"2026-08-09T16:14:44Z","snapshot_observed_at":"2026-08-11T05:19:33.989010Z","submitted_at":"2026-04-07T10:45:28Z","title":"Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:32:59.381755Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.05695"},"observation_digest":"sha256:3bd471a72477ba08cf3cdb08bc82aecf6ca1b6f2d7d8819d79b3c6fa1527837d","observation_id":"4fb48766-c116-4ff5-ba90-e5f6da5eae34","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.07812","last_updated":"2026-04-09T05:09:22Z","snapshot_observed_at":"2026-08-02T06:27:25.025040Z","submitted_at":"2026-04-09T05:09:22Z","title":"HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:20:19.653806Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.07812"},"observation_digest":"sha256:b55eced72b57586ba450d466dfe7218ccb8265fd92ae7fb5cda186271fc4ed0b","observation_id":"fe8f2b3f-4c31-4421-8f8e-7b6b1f9de0ee","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.08077","last_updated":"2026-04-09T10:48:32Z","snapshot_observed_at":"2026-08-11T04:13:42.078728Z","submitted_at":"2026-04-09T10:48:32Z","title":"AdaSpark: Adaptive Sparsity for Efficient Long-Video Understanding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:47.439019Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.08077"},"observation_digest":"sha256:37b22ef153bb36800f8731d6e625b5f3088887b4aa8f34d5960e82fa1f5a0e70","observation_id":"c7f6e111-2efb-435c-b1fa-f3126e2d2c39","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.08120","last_updated":"2026-04-09T11:40:25Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:40:25Z","title":"Small Vision-Language Models are Smart Compressors for Long Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:49.654073Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.08120"},"observation_digest":"sha256:8b6f8a33d5bcb16ad88dc3ce2c99669e6073b73c279bacd63ced627add206ec4","observation_id":"0d36e27f-b624-4232-8a0a-6456a6de7a6a","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.11399","last_updated":"2026-04-13T12:41:50Z","snapshot_observed_at":"2026-07-06T22:59:49.614780Z","submitted_at":"2026-04-13T12:41:50Z","title":"Reasoning Resides in Layers: Restoring Temporal Reasoning in Video-Language Models with Layer-Selective Merging","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:42:43.948462Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.11399"},"observation_digest":"sha256:6ca2e7908399080a5423ca4d3ac3880889ab2e39507c28e51ea10a23d72d1c0b","observation_id":"a2d7224b-1660-4b29-a8b2-0640f6d3c36e","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.14149","last_updated":"2026-04-16T15:48:38Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:59:52Z","title":"One Token per Highly Selective Frame: Towards Extreme Compression for Long Video Understanding","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:28:58.920442Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.14149"},"observation_digest":"sha256:0eef01ac82d87ff2462caca9e7b7179e1d0ccbc0f47534309be819612b20ab98","observation_id":"dde20986-fddd-4353-96d0-49af6583fab0","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.15583","last_updated":"2026-04-24T15:54:27Z","snapshot_observed_at":"2026-08-10T21:44:14.791442Z","submitted_at":"2026-04-16T23:34:51Z","title":"SAGE: Selective Attention-Guided Extraction for Token-Efficient Document Indexing","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T08:32:02.222528Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.15583"},"observation_digest":"sha256:aff73404c83dfc0881e5b9f386aae338b1786e6002cac3162f85d7384f5f8f1e","observation_id":"edf47762-9789-499e-95b4-89092e306270","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.17052","last_updated":"2026-04-18T16:22:05Z","snapshot_observed_at":"2026-08-08T21:49:06.109128Z","submitted_at":"2026-04-18T16:22:05Z","title":"OASIS: On-Demand Hierarchical Event Memory for Streaming Video Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T06:51:52.861981Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.17052"},"observation_digest":"sha256:57eea6a8570a4700ed1bacc7fbc462b0959b843da536a9363dbf839482a054ca","observation_id":"0d825d63-2330-46e5-beb2-60a149bad419","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.19564","last_updated":"2026-04-22T03:52:37Z","snapshot_observed_at":"2026-08-02T07:56:38.738222Z","submitted_at":"2026-04-21T15:15:02Z","title":"EgoSelf: From Memory to Personalized Egocentric Assistant","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T02:23:21.119521Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.19564"},"observation_digest":"sha256:a41e90bc9dcf2ea769ec008d60c63d2ce98289964163f23d0cb331d5503477b2","observation_id":"ed264919-1890-4210-a810-194c5ecf7f45","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.20473","last_updated":"2026-04-22T12:02:24Z","snapshot_observed_at":"2026-07-30T08:45:43.657043Z","submitted_at":"2026-04-22T12:02:24Z","title":"Video-ToC: Video Tree-of-Cue Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T01:20:29.374012Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.20473"},"observation_digest":"sha256:c908a66d341441c692eac1f93f5f95c32b36107e2790a2a6387d0eeb07788a34","observation_id":"2ef0ece3-f894-4748-8c2a-b7124869c768","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.21444","last_updated":"2026-04-23T09:04:32Z","snapshot_observed_at":"2026-08-11T05:12:21.621069Z","submitted_at":"2026-04-23T09:04:32Z","title":"HiCrew: Hierarchical Reasoning for Long-Form Video Understanding via Question-Aware Multi-Agent Collaboration","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T21:55:35.699057Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.21444"},"observation_digest":"sha256:9e3e1db00ad6050cd5862464a54899319e0278d66ef2e04ac09c259e05104973","observation_id":"fa674b76-523d-4ce2-96ac-602a24c065ff","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.22498","last_updated":"2026-04-24T12:26:49Z","snapshot_observed_at":"2026-07-06T23:08:51.913995Z","submitted_at":"2026-04-24T12:26:49Z","title":"CGC: Compositional Grounded Contrast for Fine-Grained Multi-Image Understanding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-08T12:26:01.568507Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.22498"},"observation_digest":"sha256:7e1007f14d28a762ae78955074d0c6822807de39631e705166e06e60edd59ec3","observation_id":"dfb2920d-67fc-491a-b61a-b28eb6e5d18b","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T14:10:27.416341Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:69193dcfa1e69f21f4392de8b2c8b4fc99e7455d08a76d890472cf9cf8591515","observation_id":"5b998405-1ec4-4dd2-b88e-ad2fa3c56b75","resolution":{"observed_at":"2026-05-12T07:08:36.726593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"cited_work":{"arxiv_id":"2406.16852","doi":"10.48550/arxiv.2406.16852","metadata_source":"pith","pith_arxiv_id":"2406.16852","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Long Context Transfer from Language to Vision","venue":"cs.CV","work_id":"52f1b946-568f-4819-9d8a-a87296f8852d","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2406.16852","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:ce928d91d533cd4f865823a84d8f3de6f69f7066a9763d31945a93cc56ac2cbe","observation_id":"441a83b3-bcfa-43fe-9b7c-3c71bebbe125","resolution":{"observed_at":"2026-07-01T08:45:34.772580Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16852/citation-record","integrity":"/paper/2406.16852/integrity","json":"/paper/2406.16852/citation-record.json","paper":"/paper/2406.16852"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm testneedleinahaystack","venue":null,"work_id":"dcd6606b-a611-488d-9f88-ac500351c4ce","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:c9dfb03f4f8d0e1d9dcbe0ee44786c577c51559c46139f0b0e9f5609761a4b61","observation_id":"c366485e-fc67-4d54-95ac-b43e3ba6b31c","resolution":{"observed_at":"2026-05-12T07:08:36.691536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"d0eddd17-3111-48c2-b719-dfad065feac7","year":2022},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:887b0ede034d98c7d5db045030f868fb194aa477c115047d4aac5371d6bfc49a","observation_id":"50743afc-919a-4f25-b93d-a8717ed4bf0c","resolution":{"observed_at":"2026-05-12T07:08:36.699662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vqa: Visual question answering","venue":null,"work_id":"e8f56797-d0b6-4240-9cef-96598039af3b","year":2015},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:2bffd52161eaf8ce7295e6467b475f105cc153b0b7995f5c32d713d08e572e08","observation_id":"659fe65a-0d19-44bc-80f1-ee50f65e057d","resolution":{"observed_at":"2026-05-12T07:08:36.703685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:26ba7e6c4b1c83dc7c2fbbcd710c0c59b92d20423f3ba6fadab5a0f33db40da0","observation_id":"4623201c-56f0-44f2-86ae-8bb725a7a67c","resolution":{"observed_at":"2026-05-14T01:52:01.553388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Longalign: A recipe for long context alignment of large language models","venue":null,"work_id":"31413e98-8678-4d3a-87d3-12a7dd4c906c","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:6ff00efada24253aaea90361058907eb2c2f74208efd031b7635430b06dce7ba","observation_id":"f2501790-375e-412d-8855-0935e1a217f7","resolution":{"observed_at":"2026-05-12T07:08:36.707886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ntkaware scaled rope allows llama models to have","venue":null,"work_id":"b2bc4ced-0dce-4d9e-bd28-6fd9acfa810c","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:41b74d5000ef1580a4d5a25de2dbb45a8cdcdd84f6f71139006cabd7805e0be1","observation_id":"ecac27f0-511d-42f0-8085-7ce36732e94f","resolution":{"observed_at":"2026-05-12T07:08:36.712440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ntk-aware scaled rope allows llama models to have extended (8k+) context size without any fine-tuning and minimal perplexity degradation","venue":null,"work_id":"61bc29bf-0161-402a-b04f-5a683f103499","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:a9f70f020ed5320cb225b4e88c7978e12d3a8189d970c40cb75353d3b182be4d","observation_id":"6d758d12-f987-4289-bbec-c07c07d1faff","resolution":{"observed_at":"2026-05-12T07:08:36.716803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"6b6d3f79-d100-4af7-8cb8-c2670a73c7f5","year":1901},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:dacba6d11406e7019f6797e0bd9729d7b0e98c5e1c99f622836ab1616bcfa6b0","observation_id":"905e55d7-98cd-4c23-9dc4-6e7238239d85","resolution":{"observed_at":"2026-05-12T07:08:36.721167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matryoshka multimodal models","venue":null,"work_id":"510e56c2-3d0f-4393-ba0f-31138efc1a0f","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:bba05f4529e1e8720a391f551b679eba1844655c2c958117f573afa52822d46a","observation_id":"5ca33b95-7cad-422d-a50d-64fa184583d7","resolution":{"observed_at":"2026-05-12T07:08:36.725016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"cerebras slimpajama-627b","venue":null,"work_id":"712752c4-d53e-4b2c-8787-9ecd1c186095","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:9f0a0f32f1546d5d27759fdcbb187073e40d035d7c557d64fa305a5d36187029","observation_id":"bf1bfdc5-d2bc-4d63-a79f-b38aa19b3a16","resolution":{"observed_at":"2026-05-12T07:08:36.180077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"2c834314-7394-40d4-9cda-458a1172cdf8","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:eb9a4f2095785f60502ff4607f1dfadb35f946c99b046a95030d80650475f894","observation_id":"a489bee3-2c34-48ed-acc4-12e190345998","resolution":{"observed_at":"2026-05-12T07:08:36.186534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":"6aae6c63-4e29-42ec-86df-c085f7ed5fa1","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:912ed0ebc4be7a30a8944966601917b370ac34d0320db2e3e4ab8866e2c9d050","observation_id":"220cbefe-a31b-48ed-af1c-e2c36a307709","resolution":{"observed_at":"2026-05-12T07:08:36.194617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":"2306.15595","doi":"10.48550/arxiv.2306.15595","metadata_source":"pith","pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","venue":"cs.CL","work_id":"c8b6df85-e7da-4bd8-90a4-d309cc2a0f60","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:33dbc000948881da376d72ecb482eb2f69253b020ce711c121f0d015c9113f30","observation_id":"ed4463ef-97d7-4ee2-ad65-4b7cea21d963","resolution":{"observed_at":"2026-05-13T10:20:58.016961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:38:12.283235+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":"2312.14238","doi":"10.48550/arxiv.2312.14238","metadata_source":"pith","pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","venue":"cs.CV","work_id":"d9e035c7-9e23-4cc2-ad3e-be080fbbf2d9","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:48fa17def79533b0917ee31ea6bad2b8aea7bcb1322157f03bab5004ea81e19c","observation_id":"c84878b0-bf24-47dc-b82a-86533c7295bf","resolution":{"observed_at":"2026-05-13T22:46:10.650334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":"267e087e-6da8-4e22-9861-3343c37f395e","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:bbe9b5e9d8e97150cd04ec4a17f3d1372290a92b24f3631f70f6d7725cd8d026","observation_id":"93a0653b-d59c-4bce-a1fe-4d7fbac8707f","resolution":{"observed_at":"2026-05-12T07:08:36.203855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T14:45:00.258967Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":"80a52590-8382-452f-bc7b-637cb876514f","year":2019},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:8c1851aa641e0dd8a2e14195f14ac29a9e6ba426b30f2a379854232430ec4109","observation_id":"c7426fe1-5d31-4fce-b4e6-9a468340e314","resolution":{"observed_at":"2026-05-12T07:08:36.210061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing command r+: A scalable llm built for business","venue":null,"work_id":"34821ec7-7233-4165-bff5-6618955fe782","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:b21d0a030fb5eff0efb760dbc5d7a7ee2432581c0ee329032c9906d5450bcf8a","observation_id":"56417ca4-2c47-41c7-9a90-51ecd373eaab","resolution":{"observed_at":"2026-05-12T07:08:36.224542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a67353e0-6103-4875-87ce-e221ba375a25","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:edadb76b6cf3dc74e5d9072ada516d768d1450ef5256f327fac2a77b31588f0b","observation_id":"9d2e526e-1e09-453c-9c98-eebfe1bd5f4a","resolution":{"observed_at":"2026-05-12T07:08:36.233354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"a116cad0-11b9-45ad-a4dc-a9744e890fff","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:46057b2600a81281aaea17d5585804e4753f79b0ebdf2fbb0843aba44aea7c2a","observation_id":"ee4847fd-1b8b-4220-a6be-7b7a231fbc9b","resolution":{"observed_at":"2026-05-12T07:08:36.241659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13753","last_updated":"2024-02-21T12:30:33Z","snapshot_observed_at":"2026-08-02T12:47:57.325302Z","submitted_at":"2024-02-21T12:30:33Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","version":1},"cited_work":{"arxiv_id":"2402.13753","doi":"10.48550/arxiv.2402.13753","metadata_source":"pith","pith_arxiv_id":"2402.13753","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LongRoPE: Extending LLM Context Window Beyond 2 Million Tokens","venue":"cs.CL","work_id":"41fabff1-11da-43da-8efd-2eb55186b9f2","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2402.13753","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:e43127366794dda24ac05958419d455bbb1bd695a7fbc6be25b7ca614714fb5c","observation_id":"4b2960b7-7bc7-4481-9f00-ce19b2ce278e","resolution":{"observed_at":"2026-05-15T08:31:04.851790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"e585e88a-a338-451e-ae45-53606f1d22f7","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:7e1bc169a5cb314512e10a628c4706f46669de579963523aeada323abf8b08d7","observation_id":"bb0033e1-04b0-4d9c-a744-711677d53bb6","resolution":{"observed_at":"2026-05-12T07:08:36.250356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data engineering for scaling language models to 128k context","venue":null,"work_id":"0cb03b2b-1e41-49c4-961f-67ce8c074efe","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d9aa337144428609df4fc72d6d12504b4ee5ec46fc5aa7351827762bf89e83e9","observation_id":"ccb39f39-a40e-484c-9d15-d677930e0011","resolution":{"observed_at":"2026-05-12T07:08:36.260561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmtest needleinahaystack","venue":null,"work_id":"901e3e73-5eae-42ca-859b-9c2dc02d772d","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:694480c31dac4ac2df8a0571da8f33f2896f439b60260783ccae54a9a003c876","observation_id":"797d774f-cc90-4cb2-8c8c-b08ef8b7f0e1","resolution":{"observed_at":"2026-05-12T07:08:36.280355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agqa: A benchmark for compositional spatio-temporal reasoning","venue":null,"work_id":"c2d834a4-739e-4c68-bb78-e037503bf245","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:07337f01728493cb468760ce061928a4890d341d61f2017066b19ee239d4daae","observation_id":"08ee7fe6-3659-4de2-8c9a-c843b8d993a9","resolution":{"observed_at":"2026-05-12T07:08:36.286095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ma-lmm: Memory-augmented large multimodal model for long-term video understanding","venue":null,"work_id":"36c89813-8f61-4a5c-aab6-44511a246eec","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:05d585752033216f0ddf9e425a8226792a7aea5102ae4494f218f47b27a01a0a","observation_id":"b59f8ffe-9c0e-4f6f-8456-14319553b247","resolution":{"observed_at":"2026-05-12T07:08:36.302349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T12:03:45.683486Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"213db0b4-bdde-4aaa-a387-c3dbb1dfc07b","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:98d04762ebc278a81e8ff5d03dbe5692df7c07e87c361e6cc1a7dcf71b00ba64","observation_id":"c59119fb-e4b1-46b1-bd9f-e2a18e02848a","resolution":{"observed_at":"2026-05-12T07:08:36.307938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":"7b5b9619-393e-4ae7-a3f5-4aa9249f2da4","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:97385053eccb44e9e18110ea828f8e414e12308d9f3b0ee096ad060af9fa74c5","observation_id":"875ff106-2979-44c8-b1aa-406718bb2297","resolution":{"observed_at":"2026-05-12T07:08:36.317510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tgif-qa: Toward spatio-temporal reasoning in visual question answering","venue":null,"work_id":"b518e599-b066-4d4b-959e-ae3de6175521","year":2017},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:2cc27830390f1723698d0bb630cd55d43252cee66fb66ab355a73f5170100917","observation_id":"431282a5-8059-404a-9b69-e2a2f43a0b22","resolution":{"observed_at":"2026-05-12T07:08:36.323053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b97339ca-d73b-4a1d-8583-e1d3268a7895","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:4a72d8511088571ef9cd000f02102a1a8374194925f00576b16f742b73b4cbe7","observation_id":"8ccc644b-33b7-4d06-8459-36c890c5d0b3","resolution":{"observed_at":"2026-05-12T07:08:36.332674Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08046","last_updated":"2024-04-05T15:21:09Z","snapshot_observed_at":"2026-07-06T16:47:17.136168Z","submitted_at":"2023-11-14T10:11:36Z","title":"Chat-UniVi: Unified Visual Representation Empowers Large Language Models with Image and Video Understanding","version":3},"cited_work":{"arxiv_id":"2311.08046","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.08046","snapshot_observed_at":"2026-07-02T16:07:09.229084Z","title":"Chat-univi: Unified vi- sual representation empowers large language models with image and video understanding","venue":null,"work_id":"4702aaae-3849-4e6b-9d23-b744d2f31d03","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2311.08046","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:cd4c15998998bc497ea31e13c536ffa195c7bab2b1f45f5e1aa30df6d2f2d2f5","observation_id":"5871f125-0798-467b-bab6-ae427a9a2ca4","resolution":{"observed_at":"2026-05-12T07:08:36.163331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":"a40f5331-9e8c-4efb-895d-d156da3515df","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:08f6cb125797c7c57bc9faac954ac955ce32597e31f52df2473ef0e423dd4efb","observation_id":"0877590c-f5dd-4a73-9700-8486f7cc4447","resolution":{"observed_at":"2026-05-12T07:08:36.344358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"d8d15886-bf5c-43f2-9da3-a0bf4be0f5c5","year":2016},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:7826e902a1c51757cfdfa96cacf0ea84e7b901ca8be971b08cee5a3e6b5873de","observation_id":"aa696503-b6b5-40f9-b092-e2abb5276edb","resolution":{"observed_at":"2026-05-12T07:08:36.352361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"9e4a2413-df9a-464b-9653-140cf58a2ecd","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:1068476afc24a9c8d6bfd48162b076832ed5797fa33e309767fea6d7cb279663","observation_id":"ad2ea75d-fdb9-4749-8943-b4db2459357b","resolution":{"observed_at":"2026-05-12T07:08:36.357791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":"178654a8-051e-4f64-84cd-66f1e1ec02b7","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:b0f9cb7cb45391f1b99e2ee6a17c7971021dc2b24a90077577e4770ba6dfb11d","observation_id":"6f1e1d1a-ad11-4aa1-9ad8-d9e3780d8638","resolution":{"observed_at":"2026-05-12T07:08:36.364272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: What else influences visual instruction tuning beyond data?, May 2024","venue":null,"work_id":"aaf6b4bb-aa46-4bde-88d4-510f67b4c4b8","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:da345d723289523be91447d95edae2194e6bc920c98480e725d95d3726b16f3f","observation_id":"4148427a-4e00-4bf7-9dc7-4495c96d2938","resolution":{"observed_at":"2026-05-12T07:08:36.368998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild, May 2024","venue":null,"work_id":"a9fcbd41-7f35-4c7d-b6a9-2c09f192fc22","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:b2663253878e895e3413f6d8c38f25a39512565c1bfc2a4fa2377b64da4c620d","observation_id":"9d162a63-2d51-4649-84b6-4574efb6e34d","resolution":{"observed_at":"2026-05-12T07:08:36.373769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":"70678071-923a-4346-af60-8bb9ef330d1b","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:63bc37eb1fd7c4e16f6b28d306e9986ae3f5c71bc5f651bb2296bc06e6f083ec","observation_id":"31f68640-8092-47cc-919c-748e02322fe8","resolution":{"observed_at":"2026-05-12T07:08:36.378469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"91da851e-5188-483c-8f33-84900ec4a249","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:e79f059f5270ea370299478aa576857775c1a3fa3ab58eefc2b2d54f3d148482","observation_id":"9ccd396b-2634-4d0b-92b0-0547650d9813","resolution":{"observed_at":"2026-05-12T07:08:36.391851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":"fdae1420-ed43-4b06-8461-f86701343e0a","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d6862260eabb8b3e73d1097afa4a521b2ebfc9f8bd44ce2756156d07145506ce","observation_id":"3e0bd944-f4ae-4368-b5de-b7ab0728c3cc","resolution":{"observed_at":"2026-05-12T07:08:36.396864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequence paral- lelism: Long sequence training from system perspective","venue":null,"work_id":"83c9d0f2-576a-40ec-9317-3581b175efab","year":null},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:aef192b35fc63ccc39197b6044a77ae0fba152f5421ac9a9d6cf5ff99889562f","observation_id":"1068bac3-20bc-41c1-90e9-06c95207df4d","resolution":{"observed_at":"2026-05-12T07:08:36.401539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.198691Z","title":null,"venue":null,"work_id":"c69dcc4d-85af-4249-accc-cbae1a0e230c","year":null},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:db011e9962415619bd7bad5374c2a202a4af46ad9de344cfe443d2636c9a954d","observation_id":"6187fefe-a1dd-4be2-9db1-77b4da39c36f","resolution":{"observed_at":"2026-05-12T07:08:36.406051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":"6cfbb047-905b-430e-9202-29dd72b8e5ea","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:ac68612eefb256793dfa734d27dd687c5c41ef79dfa9099faf8f184f41343560","observation_id":"dd08ca2c-2755-405e-bd68-230d44525070","resolution":{"observed_at":"2026-05-12T07:08:36.411011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llava: Learning united visual representation by alignment before projection","venue":null,"work_id":"bc6cd8d5-c46c-478d-a3d7-ce7ac1b0934e","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:c42f672aaf70615d93bea26c5e755c8a96a2bcd6c9c91d4564d603d86c4cdf6c","observation_id":"05ff61ff-ab17-4d8c-b015-49d4738e6899","resolution":{"observed_at":"2026-05-12T07:08:36.415948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"0bcaf7d0-0af1-4556-af88-e1da5c716591","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:5c714c7ea8287e0c2e18eb1ad8bfaf854dfdebfcc956b0fb7a018bedab51fcde","observation_id":"5313ed3a-bd0c-45ad-ae20-d32052be9d23","resolution":{"observed_at":"2026-05-12T07:08:36.421099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":"292c0dba-5916-4ff8-8a2d-88ce637cb5ce","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:fe36fa7c2cac5d911a6666c67f266072721214fdadb11f771612684b92ead641","observation_id":"bcf40407-7b27-431e-a3a0-41c56003b6cc","resolution":{"observed_at":"2026-05-12T07:08:36.426166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":"25c6be53-246f-45da-9668-6cc875e2955e","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:45e62be48619ca900bf9a5427b24f5f1a3bd6afdd0d3b9c16d9f8305ad8cf5e6","observation_id":"6ba7ff8e-32a8-44f6-a7a6-327a4b115342","resolution":{"observed_at":"2026-05-12T07:08:36.434632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"d4aac732-5a19-4092-a66c-8583bcd14f96","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:ca69ac9704b848df3485f2dcd1b82c20a4099a434e9162a4f503ff1b4f822607","observation_id":"b1937ddf-b590-47ab-a549-e1ec801731e6","resolution":{"observed_at":"2026-05-12T07:08:36.440592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.744861Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":"a84f281e-7f3f-4b95-9aaf-e3ba559cbf78","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:a8426c1c7fcfb24cfba4ceaeb76a68802b332f7a2e203cde4fef98872761778d","observation_id":"3cd987c5-616c-420a-8aed-1b523a984114","resolution":{"observed_at":"2026-05-12T07:08:36.445356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:50.449643Z","title":"Visual instruction tuning","venue":null,"work_id":"0a395ab5-dfdd-4489-ae3c-594c4431acd9","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:248a36dbdb7e13ef4a47e0cac4cc1eac8370411ebcdaacc16eab23aefdaf9afa","observation_id":"eacd7ac8-72f0-4f01-b779-7ca5b4c29200","resolution":{"observed_at":"2026-05-12T07:08:36.450601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"St-llm: Large language models are effective temporal learners","venue":null,"work_id":"a44feeb8-02cc-4ea4-ab42-d980319686ad","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:51695b2d1611506de0733857267bfe063be288ccc8bda3a738ae221c156480ca","observation_id":"edd700d0-bac1-4967-8998-027020572c2c","resolution":{"observed_at":"2026-05-12T07:08:36.455090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":"4db4eb00-9691-46b9-a26a-512afe09aeb2","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d17e99beb33c8b5eb4deb6eee438b6964d7ba9743c2c3f540597860418bc2af9","observation_id":"d4c7d364-6ab5-4c3d-a24f-00d27f75c165","resolution":{"observed_at":"2026-05-12T07:08:36.459819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding","venue":null,"work_id":"cf737642-dd10-4f78-8c03-b3d9a7347960","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:121e0cb2e304d7f9e42888fe8650278be7598dfeb4641710b882000fbc22e26d","observation_id":"a079384e-8f2a-4e1e-95ed-6bebe30694ea","resolution":{"observed_at":"2026-05-12T07:08:36.468784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"d8318cc6-f16b-4fea-a5b6-f8609b9fdeca","year":2022},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:cc4f8ab18b57764bf48a9266a11c1d52b844524dd7b36e266e0530714b2d1b7d","observation_id":"94a7c3d4-7e31-4ac8-a5cc-9bf6284d3177","resolution":{"observed_at":"2026-05-12T07:08:36.473576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T18:59:21.456734Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":"2007.00398","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-07-04T21:00:09.476068Z","title":"Manmatha and C","venue":null,"work_id":"818201c0-eeca-45a8-97ed-9a8c364a749c","year":2007},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:aa0975ec9cbb0e7e088eded5e13bf00d35ec85c33dc765770720a9284dc54368","observation_id":"9fc75294-2741-4978-a25d-8c0ab778eea9","resolution":{"observed_at":"2026-05-12T07:08:36.126572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixtral 8x22b: Cheaper, better, faster, stronger","venue":null,"work_id":"a6575fde-488a-49ed-b519-d20ec4e2b9ef","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:df85a6415df093dde073b891e8b55da2445e7c10f2e21d3b0a1485edf2f0f275","observation_id":"a4947d69-546e-4380-bd39-e5541fb74f0a","resolution":{"observed_at":"2026-05-12T07:08:36.480410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hello gpt-4o","venue":null,"work_id":"5297d67e-758a-4371-b279-e35066f4680c","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:20968d9def1c38a830f0bffddd7fc19b0c19aaf5fec1905390cd0597137aad5b","observation_id":"c1bc88f2-a0fe-4a4b-b17b-341b0e9ff8bf","resolution":{"observed_at":"2026-05-12T07:08:36.484594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12387","last_updated":"2024-04-18T17:59:48Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:59:48Z","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","version":1},"cited_work":{"arxiv_id":"2404.12387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.12387","snapshot_observed_at":"2026-07-04T10:09:45.386126Z","title":"arXiv preprint arXiv:2404.12387 , year=","venue":null,"work_id":"e8a6f1f4-737f-4845-a995-3910ae4edc61","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/2404.12387","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:6d457d139438e69ad044b086c304f61ce926347394ee2d1f9ec47d9575ff71b1","observation_id":"f429b08d-65b1-41f1-9c39-98f38a7d72e6","resolution":{"observed_at":"2026-05-12T07:08:36.171513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":"4c25e604-a3c3-47c2-af0b-118a50567dd3","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:70843493179452cbd9382486e7766693581c89e37a8bb9c3412425d19d516ca8","observation_id":"3a0800b8-10ef-4189-b47e-8c78998a67ec","resolution":{"observed_at":"2026-05-12T07:08:36.493601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T17:44:02.385618Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"9b504b15-dc15-4082-9b7e-3e0d218c00d1","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:467657cb7f805d4d2f2727bfbca85d2a24628350c9ce2895bc4ef980d67342c8","observation_id":"362b40f3-e9d5-4e64-b3a3-0416a3148c13","resolution":{"observed_at":"2026-05-12T07:08:36.499135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models","venue":null,"work_id":"bcc1a80a-0c2b-4709-8c92-af75457b8578","year":2020},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:adf387131269f73e2054bfa13b9f4b5e8c64daa479529802e31b7a67f9f0d68a","observation_id":"6c4ee3c3-bd57-4ac5-a831-05d94d02d326","resolution":{"observed_at":"2026-05-12T07:08:36.504551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Timechat: A time-sensitive multimodal large language model for long video understanding","venue":null,"work_id":"33b7984f-ecfa-48b7-9c66-019a56813698","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:98b368d6e6cbb9cfa996958ab4df66f6c51d020bc2498f1d119af9c404ff01ed","observation_id":"22c56be9-862e-450a-9f82-e8c2896aeafa","resolution":{"observed_at":"2026-05-12T07:08:36.512176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":"0a30a3a7-b354-4d70-8432-e54048a74fad","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d09bccde7d533262382a40e54042b6acc5b75e62f31381fef6d103e4587b5252","observation_id":"eca5eac4-d395-4a51-b8da-559c783345c0","resolution":{"observed_at":"2026-05-12T07:08:36.518359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-prumerge: Adaptive token reduction for efficient large multimodal models","venue":null,"work_id":"a57f88b3-cb70-4af4-94a2-e81d96e8b888","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:68a9b43037fe588967b95aa8b6c8f9a58d23ca8bf4ddf3a4be3b03a77a595327","observation_id":"0a8a4f38-3623-4c03-885a-5fb996eda2b5","resolution":{"observed_at":"2026-05-12T07:08:36.522924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Milebench: Benchmarking mllms in long context","venue":null,"work_id":"ba255036-e8aa-4f24-91de-001836bdf5fc","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:6c78ee5eca533ef1d7939f4ab0b86561bd7e5692ff79700bc6de3da623aa988b","observation_id":"1674f7d2-ad0d-4d10-b2e2-2f60d6fddc22","resolution":{"observed_at":"2026-05-12T07:08:36.527502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moviechat: From dense token to sparse memory for long video understanding","venue":null,"work_id":"daf5172c-4771-4dc1-b887-6c13b37378e4","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:9b010bdf9b24cfe8677ad2723bee0da3729d52212ac30e292a09e9d0f8cd92bf","observation_id":"583f157c-35fc-4d17-bc05-3f8668164a16","resolution":{"observed_at":"2026-05-12T07:08:36.536612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T13:43:47.715898Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":"93e16a82-d2c7-4cc3-97a6-8d82f19024d9","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:44b4306aefb88dcd00f1a4e5e3659cd2c288b8b7caebae7bdaa27f329dffe9ad","observation_id":"b7848974-2c5c-4136-a03c-02b33deed058","resolution":{"observed_at":"2026-05-12T07:08:36.542118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T03:50:39.478705Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":"2d3747fa-7ba2-404d-bc55-6a124654266b","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:74015c4e0929a8104fd773b6cd79cbac29fe5dbc3a48f73ee418d5ccf6cdab9b","observation_id":"c029ae3e-6fdb-44fc-bb6b-fc9c8dcd80a8","resolution":{"observed_at":"2026-05-12T07:08:36.546290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Palm 2 technical report","venue":null,"work_id":"ba8a5f96-ed4b-4735-8bf9-7fc0cd1ca2e6","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:f89b5fd99dd946145574cf79573ad10804e388db8b58f7cc9042f0cca86c15cc","observation_id":"bac81060-eebc-4633-b315-0f6d9ccc293b","resolution":{"observed_at":"2026-05-12T07:08:36.550347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Introducing qwen-vl","venue":null,"work_id":"bdfb782a-9068-4561-8ad4-32f802237338","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:a22f50121e565d401b752709f4bdfa01633838f1142766d4b8da33ca19edf32c","observation_id":"890e38de-801d-4718-939d-7bebca8c8dfd","resolution":{"observed_at":"2026-05-12T07:08:36.554914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen2 technical report","venue":null,"work_id":"9d2d8bd6-4a7e-4bac-861f-2d20a1164183","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:5275e4dea0bd2512fdd9208f8da121841c2ccc0988dbb50956d9e02d0c6954ed","observation_id":"1d8b253b-215e-4eff-ad1b-67c920b7621e","resolution":{"observed_at":"2026-05-12T07:08:36.563452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":"b228222c-41da-4f67-8fd7-c4fa5c17771a","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:31e9ef7211807fadb2f24908ee3952a1960fa720b73162d24bb2461d519f1309","observation_id":"cd07319c-223f-42b7-bcd9-21871d48c9dd","resolution":{"observed_at":"2026-05-12T07:08:36.568777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal needle in a haystack: Benchmarking long- context capability of multimodal large language models","venue":null,"work_id":"4603025a-fc85-49ef-8f4b-63bf9e0304f3","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:72f4b912d04a1176157949dfa8a12eb3754f03939b3bcf7610fb7e822388eae2","observation_id":"60c8d302-c1c5-4a5f-90a3-d4a61b5f0a8b","resolution":{"observed_at":"2026-05-12T07:08:36.573521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:26:26.024850Z","title":"Lvbench: An extreme long video understanding benchmark","venue":null,"work_id":"65ca7e8b-a7bf-4bb8-85d7-53fb6230d86b","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:bd3958462a6302f4b213a88f2b31e15384b78628017026c65c7ea029a6bc99e9","observation_id":"c89d548b-72b7-40db-a0ec-f0fee689e4f6","resolution":{"observed_at":"2026-05-12T07:08:36.577663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"d634fbca-1076-4ba5-8851-bea128f45d48","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:c82640bed37b2012dc32f24013bf2735b359dda50dde84c4f73caebcc5a10c1d","observation_id":"7de1d54a-32a6-4c68-beba-338643ade4f5","resolution":{"observed_at":"2026-05-12T07:08:36.583061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Star: A benchmark for situated reasoning in real-world videos","venue":null,"work_id":"e33be0d2-3921-48ef-b4a6-1356064fbf9d","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:19738f423058a8929addd31b6bd9f37d4ac5b1bb2eba7c0736791f7876278682","observation_id":"815cf966-3643-4aa2-b0c2-96a36dd569ef","resolution":{"observed_at":"2026-05-12T07:08:36.595155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grok-1.5 vision preview, apr 2024","venue":null,"work_id":"f3bfdd65-4db5-49da-af3d-0a82a65e85d7","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:0a58a18dcaee379587414842e8dfebb5aa02338488cd2d3b2aad8f2856c7b8db","observation_id":"d27cf5b0-d787-4d81-901f-26b4cdd0c1fc","resolution":{"observed_at":"2026-05-12T07:08:36.600394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa: Next phase of question- answering to explaining temporal actions","venue":null,"work_id":"8aef5aa9-40f1-4f88-8065-e1fc77a794ee","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:0f8b99a41078be0d9b3db14fc2b3b94530949ff38a64b7539d62cddb9939b5c6","observation_id":"c9bf17de-a013-41a3-881a-48e082babbd4","resolution":{"observed_at":"2026-05-12T07:08:36.606025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Next-qa:next phase of question- answering to explaining temporal actions","venue":null,"work_id":"72c5127a-e847-41d4-862f-2d1381f40cf0","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:831043f1ecdc47135415bb8df0fbfa81caab04bec4927276fe5c95f5b81d9808","observation_id":"50eeabdb-7b33-4489-92a2-6b9a02b69970","resolution":{"observed_at":"2026-05-12T07:08:36.613458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Funqa: Towards surprising video comprehension","venue":null,"work_id":"fdabb537-6373-4833-a126-ce75cdf511e1","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:e9673bad05879446b5597551b058ab151b9addc5f5571974e883d1d552eedeb8","observation_id":"46ec1724-4ac3-48eb-8de5-ec81857ad3aa","resolution":{"observed_at":"2026-05-12T07:08:36.621512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective long-context scaling of foundation models","venue":null,"work_id":"ff918550-477c-4fe7-9f94-15948f249c26","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:c744e2629149518c07fda2fad7a27097f2aae00b5d15eaf95251f0d265565c0a","observation_id":"d3f810b7-8414-48ae-893f-9cbc8e4c28e1","resolution":{"observed_at":"2026-05-12T07:08:36.626200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video question answering via gradually refined attention over appearance and motion","venue":null,"work_id":"08125409-76bc-4743-9dc0-224af0139889","year":2017},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:31878d0c7ad4647c914fc5918e9ae54b2f0fcede1aa32d5a29590c7562211985","observation_id":"c2a5815c-bbda-47d8-a9c0-54cd7c814fc0","resolution":{"observed_at":"2026-05-12T07:08:36.631082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sutd-trafficqa: A question answering benchmark and an efficient network for video reasoning over traffic events","venue":null,"work_id":"5129ec12-2686-4ad1-a35f-1c25b855ff97","year":2021},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:944386271ad821b875a75d9d0a15a605625a196ad2eb5f9eb246076a8fbff02f","observation_id":"c44cc93b-e53a-4149-8024-8f5617e657aa","resolution":{"observed_at":"2026-05-12T07:08:36.635163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":"9abf8f95-dba6-46cc-bf98-2d5029f20619","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:9f6f2e06707e6e8c300ce8cee75560c3b41d17c801686e4ce5625fa921606548","observation_id":"2f87c9ed-ce08-4778-816f-5ac8eca9957e","resolution":{"observed_at":"2026-05-12T07:08:36.639613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01442","last_updated":"2020-03-08T00:09:07Z","snapshot_observed_at":"2026-07-06T08:26:38.349660Z","submitted_at":"2019-10-03T13:16:36Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","version":2},"cited_work":{"arxiv_id":"1910.01442","doi":"10.48550/arxiv.1910.01442","metadata_source":"pith","pith_arxiv_id":"1910.01442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CLEVRER: CoLlision Events for Video REpresentation and Reasoning","venue":"cs.CV","work_id":"595fdbf7-89d5-4593-8f57-24e8b469a43c","year":2019},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"cited_paper":"/paper/1910.01442","citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:b2fee02d24d837306494de2d3acc5bee83b4b86ef42fd53cdccbe60935e48faa","observation_id":"1217a881-608e-4e7d-b897-e1f6cfcf5548","resolution":{"observed_at":"2026-05-16T18:01:50.618167Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T20:53:53.698369+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"97687276-1dff-4244-af66-f6cf8dc953c7","year":2019},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:916eb5b7eff94831ae538e155d037cacc3db0fbcacf8ef7563a0ede982c82b26","observation_id":"44614c79-4a71-45db-923e-2a8c9200fa7e","resolution":{"observed_at":"2026-05-12T07:08:36.644209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Activitynet-qa: A dataset for understanding complex web videos via question answering","venue":null,"work_id":"b2596912-8fde-4d1a-a918-ac717fc3f7d0","year":2019},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d2e41b417d23ec9aa85f036d29978bf891c72a8f426174a8fcd0841971eb18de","observation_id":"d2a1a64a-f7d7-4198-8486-7ecd377754d9","resolution":{"observed_at":"2026-05-12T07:08:36.651693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"dfc182d0-8d8f-4283-a5b1-1c1036d5bd81","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:777d1c4eb56d8dd40aeb9a91141890d5f0f6811aed14462207822649c40fb347","observation_id":"1010d5e6-5683-4497-b6c1-516232eac650","resolution":{"observed_at":"2026-05-12T07:08:36.659926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"fd2ad850-2d03-4fc5-ab85-73fbb9c471e9","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:f8f6dcde5510edeb32c4eb768d693593994cad9bdbaac745ecabc65a550e6bc9","observation_id":"16d9716a-4914-4a9c-9aa2-e5951806d5ff","resolution":{"observed_at":"2026-05-12T07:08:36.664644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization of video large multimodal models from language model reward","venue":null,"work_id":"69307d1b-147b-430f-8f11-537c79beeb91","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:403296bca5a4c4c91976f99a768b655fce0f2d765f3fa7e2cce61bcb22ca752d","observation_id":"6d7b7e90-727c-4797-8520-f6de88b6d6bb","resolution":{"observed_at":"2026-05-12T07:08:36.669125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-next: A strong zero-shot video understanding model, April 2024","venue":null,"work_id":"67a7d98c-2312-4d95-ab39-657d480404dd","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:064b16866999c7153cc75d2b9a98a5ff60245d29db261faadcecaf0a3fb89dfc","observation_id":"f209fbee-f0be-4c60-b5a1-79fbef8c552d","resolution":{"observed_at":"2026-05-12T07:08:36.673760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mlvu: A comprehensive benchmark for multi-task long video understanding","venue":null,"work_id":"0a4403e0-eac2-4ae0-a340-fb8f0ac9b68c","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:779a60beefa9fe1d9356192586321e1cfa88ef514f10587f447997ed1b5184a2","observation_id":"67836fc9-a424-498c-b75b-ecf15dfc5b77","resolution":{"observed_at":"2026-05-12T07:08:36.678185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Streaming dense video captioning","venue":null,"work_id":"e4060384-d489-4799-9afa-dbcd0ffe9a83","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:a9b2f916d5d691a62b91beae916651ba9c4e271aebd524647787227245181c02","observation_id":"01160dc2-3cda-4ca2-8568-cf65190e437e","resolution":{"observed_at":"2026-05-12T07:08:36.682616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minigpt-4: Enhanc- ing vision-language understanding with advanced large language models","venue":null,"work_id":"db0b70b9-01f1-4029-b5c9-e3d7e0402a73","year":2023},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:d6bd59e263a0de6e2c0560bacbc418bfd8b62815f4412261579761492f5bb0e8","observation_id":"bd86627d-912b-4fed-94ca-7b72dffa1ecf","resolution":{"observed_at":"2026-05-12T07:08:36.687674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ring flash attention","venue":null,"work_id":"68fef535-768e-4de2-a995-7c5269ebff81","year":2024},"citing_paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T07:08:35.946669Z"},"links":{"citing_paper":"/paper/2406.16852"},"observation_digest":"sha256:3face2444aaecf3d5e7dcc63d102b8a7c76a266f5fecec762a1ede0dc4532cb4","observation_id":"4ff52b4b-5133-43f6-8835-03c7cf80f707","resolution":{"observed_at":"2026-05-12T07:08:36.695375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.16852","last_updated":"2024-07-01T02:59:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:52:45.942315Z","submitted_at":"2024-06-24T17:58:06Z","title":"Long Context Transfer from Language to Vision"},"reference_resolution":{"displayed":94,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":2,"verified_exact":6,"verified_fuzzy":84},"total_outbound_references":94},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 94 of 94 outbound references and 100 inbound Pith citation observations for arXiv:2406.16852."}