{"as_of":"2026-08-10T08:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59ada6ef96f8610c08606000fc7b4a7af536039b211aa4298a01f3528cc0c988","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:56:05.432793Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:46:51.641946Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:19:29.938511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-08-02T20:14:05.052870Z","title":"Dyntok: Dy- namic compression of visual tokens for efficient and effective video understanding.arXiv preprint arXiv:2506.03990, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00198","last_updated":"2026-07-01T00:40:56Z","snapshot_observed_at":"2026-08-08T00:25:26.077628Z","submitted_at":"2026-02-27T08:11:06Z","title":"Stateful Token Reduction for Long-Video Hybrid VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:14:05.052870Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2603.00198"},"observation_digest":"sha256:5143316f36ba8b9ce309d0e0c8aaaf048eac27d878ab85be5a121e80021c983d","observation_id":"5b063c2e-aa4d-4da7-973c-621e23709d06","resolution":{"observed_at":"2026-08-02T20:14:05.052870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-07-04T03:19:29.938511Z","title":"arXiv preprint arXiv:2506.03990 , year=","venue":null,"work_id":"9f7446a4-8c5a-4dea-b3ba-b307cabcb570","year":null},"citing_paper":{"arxiv_id":"2606.19849","last_updated":"2026-06-18T06:57:31Z","snapshot_observed_at":"2026-08-06T15:40:32.013079Z","submitted_at":"2026-06-18T06:57:31Z","title":"ViCoStream: Streaming VideoLLMs Can Run Beyond 100 FPS with Stage-Wise Coordinated Inference","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T18:17:53.013043Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2606.19849"},"observation_digest":"sha256:9126eb825a32e1eb652b4d6c385d41a96e0030868fb8e2fec38ce5a418df38a9","observation_id":"3bcde7a0-8149-44a2-85f6-c3ce2e762161","resolution":{"observed_at":"2026-07-04T03:19:29.940719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":"2506.03990","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-07-04T03:19:29.938511Z","title":"arXiv preprint arXiv:2506.03990 , year=","venue":null,"work_id":"9f7446a4-8c5a-4dea-b3ba-b307cabcb570","year":null},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:cf7f77f845b22ffae531dcb481f0cfd94cbea14407f31c53b43758c3b8a2d4aa","observation_id":"62bd9af1-87b9-4723-8fd0-00f2d8d2e4a5","resolution":{"observed_at":"2026-07-01T11:55:42.206405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03990","snapshot_observed_at":"2026-08-04T23:46:51.641946Z","title":"arXiv preprint arXiv:2506.03990 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-08T16:21:27.207921Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.641946Z"},"links":{"cited_paper":"/paper/2506.03990","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:bf2f113dec47d5ffb3a80e3d2991b58a4b133b370abb0f3ab9834ea147214e45","observation_id":"84d2da63-359b-4e4c-9943-42b6095c3fb3","resolution":{"observed_at":"2026-08-04T23:46:51.641946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03990/citation-record","integrity":"/paper/2506.03990/integrity","json":"/paper/2506.03990/citation-record.json","paper":"/paper/2506.03990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.981119Z","title":null,"venue":null,"work_id":"6b3bf6b9-84be-4c54-b00d-273296175148","year":2022},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.276195Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:f61041e5f97e4c739924d7608681876ad6c86d2865233d66ab3246763280e8b0","observation_id":"aa61887c-8890-4ecc-bfdf-96752c60cec1","resolution":{"observed_at":"2026-08-07T10:56:05.984503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.970665Z","title":null,"venue":null,"work_id":"e4219b2a-717e-410d-a485-c9b42ddb5d7e","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.280476Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a52d91f243942d981a46866d0ee52e85758bf1f37d1476ff9452ae3972988e66","observation_id":"dc61cc26-beb8-430d-85f6-82c0ca483762","resolution":{"observed_at":"2026-08-07T10:56:05.974300Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.959770Z","title":null,"venue":null,"work_id":"7cf67ebf-1e58-483f-a370-0c73dcd04d9b","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.284562Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:b623f9481244a5ea30a6e8b99631dc7473aefad82f96baec0e83871aa9bf7fda","observation_id":"c79db32a-ddd9-407a-a895-d22bc85a8470","resolution":{"observed_at":"2026-08-07T10:56:05.963475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.948786Z","title":null,"venue":null,"work_id":"a910f232-63dc-43c6-a651-6bb62a8806f9","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.288049Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ecd3b8cd2e5e4944add7620d74ce1fe3b1ec3b13b5ade4cc2351f2cbb13dde68","observation_id":"e9bc4e7f-5737-47b7-bc18-3eda5692741f","resolution":{"observed_at":"2026-08-07T10:56:05.952522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17247","last_updated":"2024-05-27T15:01:23Z","snapshot_observed_at":"2026-07-06T18:20:39.922334Z","submitted_at":"2024-05-27T15:01:23Z","title":"An Introduction to Vision-Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17247","snapshot_observed_at":"2026-08-07T10:56:05.291412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.291412Z"},"links":{"cited_paper":"/paper/2405.17247","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:276d909656a0b2ed0abe2e11be359ea2e3b5e00b68a5ebe976790a2e2844b375","observation_id":"2a779ba7-a508-414c-a14a-7e710aa26f10","resolution":{"observed_at":"2026-08-07T10:56:05.291412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T10:56:05.295051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.295051Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:af7e99c962ec65b705824afce4341e156e3edd73c308965cf554bff16c9a916d","observation_id":"d4c6e30f-30cf-4d31-b3da-6649ec251dc0","resolution":{"observed_at":"2026-08-07T10:56:05.295051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:56:05.298607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.298607Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:0acfab7e8008e7fd577c05711cfbb1a5901d0eb4cb846a47515027ac4fa6b83f","observation_id":"33af4884-a719-4c17-889e-bf36fe9aa410","resolution":{"observed_at":"2026-08-07T10:56:05.298607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-07T10:56:05.302047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.302047Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:7b9597ee1c24fc7cdf10a1c1aeb6d85b6767895734c940913271239d20924091","observation_id":"9dc5e770-71cc-4304-8aad-4f9b10a4b007","resolution":{"observed_at":"2026-08-07T10:56:05.302047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-07T10:56:05.305472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.305472Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:6a3bd0cd7483ae909187260b4f95bc49dafd033df009cfe3f3f46351b3d8a6f4","observation_id":"26f4b637-9060-4488-80eb-9c2a838b3e8f","resolution":{"observed_at":"2026-08-07T10:56:05.305472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01986","last_updated":"2025-07-24T18:44:26Z","snapshot_observed_at":"2026-07-06T20:16:18.023949Z","submitted_at":"2024-12-30T17:31:37Z","title":"FrameFusion: Combining Similarity and Importance for Video Token Reduction on Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01986","snapshot_observed_at":"2026-08-07T10:56:05.308899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.308899Z"},"links":{"cited_paper":"/paper/2501.01986","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:cf40b5e68f95ea5d673598b95b34f1e27420f838266d718a04512d910d0c2812","observation_id":"a916a4f9-d205-473b-b4f7-13df30d1a489","resolution":{"observed_at":"2026-08-07T10:56:05.308899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19315","last_updated":"2024-06-07T03:39:04Z","snapshot_observed_at":"2026-07-06T18:22:10.094519Z","submitted_at":"2024-05-29T17:39:42Z","title":"Matryoshka Query Transformer for Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19315","snapshot_observed_at":"2026-08-07T10:56:05.312460Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.312460Z"},"links":{"cited_paper":"/paper/2405.19315","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:dc003b5e612f2f6be8d1e8a5230d2ca48dec9d0b6cf57ff46e65f404595ff337","observation_id":"d5b5039e-25b6-42c4-90b9-336ed569aca1","resolution":{"observed_at":"2026-08-07T10:56:05.312460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.938259Z","title":null,"venue":null,"work_id":"84f429e0-e05d-4407-b8f9-5158e6a15069","year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.315715Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a8a5f989827a265bf390fdeb77c0baa7ba4e5cfd60feed9d1d4c3fd6d1ee1e0b","observation_id":"e6f80ed6-3d9b-4dc6-b009-6f5c563b7436","resolution":{"observed_at":"2026-08-07T10:56:05.941866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.318608Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.318608Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:1a99d2186e7055c4c35fdb0cbad4a1598f30c57c9452eb787e209ccb04031656","observation_id":"da39ac70-4056-459d-bb73-49d2f7a73fe0","resolution":{"observed_at":"2026-08-07T10:56:05.318608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T10:56:05.321429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.321429Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:90a6b227c77d2cef32fbacd36e3d7acbf41e98b42ac2e22f1b982f36f52feccf","observation_id":"264fb417-cc39-45a4-a218-e19a0cc9fa8d","resolution":{"observed_at":"2026-08-07T10:56:05.321429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.324395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.324395Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:70c3efc22e86ef326345794d7ed15325e2202f1e0532ed80a4ed7d27e5cdfff4","observation_id":"dfbdef21-7869-468d-8320-59bfb76e569e","resolution":{"observed_at":"2026-08-07T10:56:05.324395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T10:56:05.327297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.327297Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:55cacea76856210456ada2603db268d1f12c4cdc3b86bc3cd2dc224da5a0f873","observation_id":"fb72792c-376e-40b7-80b9-4ed91c6044b2","resolution":{"observed_at":"2026-08-07T10:56:05.327297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.913609Z","title":null,"venue":null,"work_id":"b6f215b7-aad0-4948-99e3-627cad945cbc","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.330290Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:7bfa4814be902b9ec87d680c87fa286d7ab82ba55b099f053217d49fda8d8c64","observation_id":"13319851-0f2b-40b7-8362-c5ffbd386569","resolution":{"observed_at":"2026-08-07T10:56:05.918195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T10:56:05.333184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.333184Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:e2c589669f8a0930b8b5ffd2615bc5f4ba09cca4c964ae6e4f8164a6c584c33b","observation_id":"81818563-8738-439b-a096-f401ce88c5b9","resolution":{"observed_at":"2026-08-07T10:56:05.333184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.336628Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.336628Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:3ffda06d687187fa389e34e3c482a9c0e62659e9755258abd4e80fa9aa3bd1e8","observation_id":"2ac41062-a81f-4c23-8768-e9838f583c2a","resolution":{"observed_at":"2026-08-07T10:56:05.336628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-09T01:53:18.568676Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-07T10:56:05.339561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.339561Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:204b84f1a8052e3f612da105958acf0e6a43ce9a737617df9a46f1127237a80e","observation_id":"bac04eb9-4d82-49b6-bc64-11e7635497c8","resolution":{"observed_at":"2026-08-07T10:56:05.339561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.897504Z","title":null,"venue":null,"work_id":"5261f50d-d0a9-451a-8418-b3854c6356e8","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.342903Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:b0347c0f7e5b4b5ea069cdc9403f2d9ce1ea148d3b02ba09d628d848bdd6ca99","observation_id":"8f293930-0977-4141-a852-9528cbacc60f","resolution":{"observed_at":"2026-08-07T10:56:05.900748Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.886401Z","title":null,"venue":null,"work_id":"d8a9ffa4-efa8-441c-8037-af5126c7e409","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.345833Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:87638c1db59aae02c088e77742ab4a4e40735a82fd0a5ed8e408d6b1bf30d97f","observation_id":"b21742c1-cb48-48f8-9e18-72ff9f469fec","resolution":{"observed_at":"2026-08-07T10:56:05.890243Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.875465Z","title":null,"venue":null,"work_id":"d1a92aa2-d5f1-48eb-8d06-0d562a1f0aa1","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.348695Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:7f81a2c129a452eebfaae5fd9cb07c2d7c47c4bf07ed736b9196c890890ee939","observation_id":"20152ca6-858c-4b66-ad82-e400bf1af8e4","resolution":{"observed_at":"2026-08-07T10:56:05.879074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.864382Z","title":null,"venue":null,"work_id":"916908b5-1dcc-4a63-a487-4fd8f1ebca84","year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.351703Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:0d8f19db4a47bb2f32a1b1f872e8ba4d46a6928464a2d5f6a7b5207eec34e8ed","observation_id":"0d1ff616-b72e-42c1-8406-557aaa997bec","resolution":{"observed_at":"2026-08-07T10:56:05.868075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16267","last_updated":"2025-06-09T19:33:32Z","snapshot_observed_at":"2026-07-06T19:37:16.203681Z","submitted_at":"2024-10-21T17:59:11Z","title":"xGen-MM-Vid (BLIP-3-Video): You Only Need 32 Tokens to Represent a Video Even in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16267","snapshot_observed_at":"2026-08-07T10:56:05.354802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.354802Z"},"links":{"cited_paper":"/paper/2410.16267","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ef28bb80c8fa29316a255552cea397d758a9d25a75c5fcf03576ae285775db7a","observation_id":"53677ca5-1ac8-42b3-9335-e3510cf0ee6d","resolution":{"observed_at":"2026-08-07T10:56:05.354802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.358235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.358235Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:961a67541b070483a28263c48b49365d0febd57db4a2810cbb49fe1c7cde0e84","observation_id":"64ec724f-b4c6-4fcc-a125-e0bdab7eedd9","resolution":{"observed_at":"2026-08-07T10:56:05.358235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15024","last_updated":"2025-03-28T14:11:37Z","snapshot_observed_at":"2026-08-10T05:54:28.884157Z","submitted_at":"2024-11-22T15:55:19Z","title":"DyCoke: Dynamic Compression of Tokens for Fast Video Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15024","snapshot_observed_at":"2026-08-07T10:56:05.362186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.362186Z"},"links":{"cited_paper":"/paper/2411.15024","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a5b7dbe9516aeb3931e2e2ec058d39afc188b29e690145b6a237ff01b56d0033","observation_id":"f2792e61-63a5-472a-8d51-e05cbbedfa04","resolution":{"observed_at":"2026-08-07T10:56:05.362186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T10:56:05.365504Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.365504Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:f249e1f702c0b49d8d0addd0a7aec5d12ad6f86d3e06edcade7af288b28216e7","observation_id":"106473ca-fc15-413e-9740-5656892a4c6f","resolution":{"observed_at":"2026-08-07T10:56:05.365504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T10:56:05.368592Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.368592Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:1c740268ba8e717d49ba140a2624e528748b766ca80945095bef9ec686765862","observation_id":"64346559-2710-49cb-890b-c1fc11bfaf92","resolution":{"observed_at":"2026-08-07T10:56:05.368592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09530","last_updated":"2024-12-12T18:20:41Z","snapshot_observed_at":"2026-07-06T20:06:09.333397Z","submitted_at":"2024-12-12T18:20:41Z","title":"Dynamic-VLM: Simple Dynamic Visual Token Compression for VideoLLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09530","snapshot_observed_at":"2026-08-07T10:56:05.371800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.371800Z"},"links":{"cited_paper":"/paper/2412.09530","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:b6ff7d208b12fdbaa1ac377c86afa6bf7511ee07c84d9370ac6959cfb12c0112","observation_id":"559084cc-f064-4cc9-8f56-f56b9d8f608a","resolution":{"observed_at":"2026-08-07T10:56:05.371800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T10:56:05.374864Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.374864Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:c0680da65297d9fddca12832b741e7f2a692298656f9a3af2cee5cee8545f46e","observation_id":"73c33537-a5e3-4dc3-b645-08885b5d2b8c","resolution":{"observed_at":"2026-08-07T10:56:05.374864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.854070Z","title":null,"venue":null,"work_id":"355e8719-15ed-4897-9afe-68ec45dcf8f2","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.377969Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:626951431abb40b358ccbb1d61cd36e0227b41ad527d023bd30bf17871fd7ed3","observation_id":"5f45281d-0bfb-4c17-81bc-01fc47dc6ea7","resolution":{"observed_at":"2026-08-07T10:56:05.857436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.843743Z","title":null,"venue":null,"work_id":"c02e792f-1d66-463b-a43e-7ebe0ad01500","year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.380731Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:f62d7d30d615a8fd828ffa517616265d71f5893ca4a4ae4ec3de7ee7e083cc8c","observation_id":"fe533a48-10ce-4d8c-beb2-38ac03429af0","resolution":{"observed_at":"2026-08-07T10:56:05.847252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15754","last_updated":"2024-07-22T16:00:55Z","snapshot_observed_at":"2026-08-06T14:12:05.548569Z","submitted_at":"2024-07-22T16:00:55Z","title":"LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15754","snapshot_observed_at":"2026-08-07T10:56:05.383591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.383591Z"},"links":{"cited_paper":"/paper/2407.15754","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:8ad666023ffa908097a24e28ce804fd4f9af166523641db3025339f574121105","observation_id":"ca11976d-f9ad-4707-a57a-bbee01e75148","resolution":{"observed_at":"2026-08-07T10:56:05.383591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.831069Z","title":null,"venue":null,"work_id":"7db71654-ad47-45ed-af24-aab53c9acd29","year":2021},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.386907Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:65e44795d15e8c65b621cb1f4e293fe1f20a78b0c9cb8f6d88db05eb496212cb","observation_id":"8ae79a53-3939-4976-a6e4-916cb7ee8073","resolution":{"observed_at":"2026-08-07T10:56:05.835679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-08-07T10:56:05.389890Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.389890Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:55129ced2d3d3a82b525d053c1bdc980581c8a8e42705063185344792c9f16d4","observation_id":"b80eb3c8-54d4-45d1-975d-01eed4caa809","resolution":{"observed_at":"2026-08-07T10:56:05.389890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T10:56:05.392924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.392924Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:cc97b2e7f9fde061de6aaccccdfb0f7aec0536bfdfd2f8bed26d499edbbf994d","observation_id":"6a589e1a-66ac-416d-80f8-67ffa2397b8b","resolution":{"observed_at":"2026-08-07T10:56:05.392924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.396090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.396090Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:5ad6dcd09d8bec551d0ad24d64fccdb624f79020ad6c640cdc7107ab15a1f5bf","observation_id":"c81d325b-2bb5-4b51-8784-28bdf7bd4a62","resolution":{"observed_at":"2026-08-07T10:56:05.396090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:56:05.399011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.399011Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ef06425f4b072a3fa773533e5fb026cb3a159c6dfdb9b504f71a4872f62b386d","observation_id":"2d1ab832-3f2b-4656-a918-af0566f5aa48","resolution":{"observed_at":"2026-08-07T10:56:05.399011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15343","snapshot_observed_at":"2026-08-07T10:56:05.402373Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.402373Z"},"links":{"cited_paper":"/paper/2303.15343","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:86e55f2a8fd18808756b6ccf1efdd541f20a1865bd9254d7ff0771017999f0f9","observation_id":"6e6a6b50-4c14-491e-9a18-6c60e07f2cc0","resolution":{"observed_at":"2026-08-07T10:56:05.402373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-07-06T18:47:56.109836Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-07T10:56:05.407052Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.407052Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:ac72b8622d55f1401fd40c03d677cf7e64c91ac3f0e011029642bb3e00cd683d","observation_id":"29db3ad9-d287-4e59-8754-7cbb96c444d0","resolution":{"observed_at":"2026-08-07T10:56:05.407052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T10:56:05.411061Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.411061Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:028577d848472d5f9829a1d7340038ead772372034601a5dd5d226fd76858cf3","observation_id":"d1f0c0cb-268c-402c-aad2-c20d039f92d4","resolution":{"observed_at":"2026-08-07T10:56:05.411061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-07T10:56:05.418612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.418612Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:025797d4ba00592c0d2b7288fba61d87d31c5613166755c241c7ee4b088e623d","observation_id":"500a1ece-fc59-4481-a16d-988122648280","resolution":{"observed_at":"2026-08-07T10:56:05.418612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04264","last_updated":"2025-01-01T15:53:58Z","snapshot_observed_at":"2026-08-03T20:38:36.602554Z","submitted_at":"2024-06-06T17:09:32Z","title":"MLVU: Benchmarking Multi-task Long Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04264","snapshot_observed_at":"2026-08-07T10:56:05.421882Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.421882Z"},"links":{"cited_paper":"/paper/2406.04264","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a60f880aa2f38f15182f10cdb8230156934b9404a5833ad979a184cdf8702ba9","observation_id":"a0b9f381-ede6-48c1-903c-f0c0bcad59ca","resolution":{"observed_at":"2026-08-07T10:56:05.421882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.425465Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.425465Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:a1b0d26ab5c28389278b1e69011f34787a610a16f8fa05f1968b5f3251440fb2","observation_id":"1ad1be84-66b9-4d36-9bc9-d868946137e9","resolution":{"observed_at":"2026-08-07T10:56:05.425465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.428727Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.428727Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:79c3751fb079957ff184911693bbae25e9f33dcf4086ea1179a41616a39cd568","observation_id":"4cc700f1-1743-4f53-81f9-3d7a5be55d0b","resolution":{"observed_at":"2026-08-07T10:56:05.428727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:56:05.432793Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.432793Z"},"links":{"citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:01976dbbfcb55d21ec679b3942e8b38252b878f58c92d368652a385e93be5b4e","observation_id":"b331cc54-46dd-4cba-be33-02492310fb91","resolution":{"observed_at":"2026-08-07T10:56:05.432793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:23:11.832180Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2506.03990."}