{"as_of":"2026-08-07T16:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:874c1e5b03e0cd4b2a4f589039e6c534dd434fe638cdeebd1e114b433805ae9d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:45:47.521580Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:15:44.617819Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":"2407.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-01T10:15:44.617819Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"94acb309-ae67-47f3-96f5-f72bad1cb617","year":2024},"citing_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-07T09:36:29.319006Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T11:35:25.894465Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2411.10440"},"observation_digest":"sha256:7862f988e48e6e8f07137899ddda58f1b2975aa23098d0043d7b588ac3755081","observation_id":"5ecbc9d4-5d8e-43c3-a3a6-0753f84636a3","resolution":{"observed_at":"2026-05-16T11:35:25.953654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T12:45:47.521580Z","title":"Tokenpacker: Efficient visual projector for multimodal llm.arXiv preprint arXiv:2407.02392, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23727","last_updated":"2025-05-29T17:55:49Z","snapshot_observed_at":"2026-08-07T12:36:34.635556Z","submitted_at":"2025-05-29T17:55:49Z","title":"PixelThink: Towards Efficient Chain-of-Pixel Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:47.521580Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2505.23727"},"observation_digest":"sha256:a3d402d6192696e465a588f22260565a5b821d730f4547868cbc618f4a506c14","observation_id":"2ad7117d-d750-496d-bf95-cb4432bb11c7","resolution":{"observed_at":"2026-08-07T12:45:47.521580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T12:09:04.930789Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00479","last_updated":"2025-05-31T09:10:43Z","snapshot_observed_at":"2026-08-07T12:02:00.195241Z","submitted_at":"2025-05-31T09:10:43Z","title":"EffiVLM-BENCH: A Comprehensive Benchmark for Evaluating Training-Free Acceleration in Large Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:09:04.930789Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.00479"},"observation_digest":"sha256:6a7bdf9121a7ddd67dcf01630f9decf44d096e07c3618431d2b250d85d77b099","observation_id":"9f5a24b9-6c20-4983-ad8f-d9e2bcdde671","resolution":{"observed_at":"2026-08-07T12:09:04.930789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T10:56:05.333184Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03990","last_updated":"2025-06-04T14:17:42Z","snapshot_observed_at":"2026-08-07T10:47:31.423763Z","submitted_at":"2025-06-04T14:17:42Z","title":"DynTok: Dynamic Compression of Visual Tokens for Efficient and Effective Video Understanding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:56:05.333184Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.03990"},"observation_digest":"sha256:0a5d684ceb88c8067c2bb13056b492d27fe4de5c2b3f4285983c37428c8fe716","observation_id":"81818563-8738-439b-a096-f401ce88c5b9","resolution":{"observed_at":"2026-08-07T10:56:05.333184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T10:34:48.866029Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04997","last_updated":"2025-06-05T13:06:01Z","snapshot_observed_at":"2026-08-07T10:26:27.903134Z","submitted_at":"2025-06-05T13:06:01Z","title":"Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:34:48.866029Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.04997"},"observation_digest":"sha256:46218405a5fd73ac2ae8da464708acf69c9e0fc985dd827ccb8dfc0e800ee5ee","observation_id":"f1413e60-66b2-4474-8cc5-4e90d4930ee2","resolution":{"observed_at":"2026-08-07T10:34:48.866029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T10:29:09.538863Z","title":"Tokenpacker: Efficient visual projector for multimodal llm.arXiv preprint arXiv:2407.02392, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05287","last_updated":"2025-06-05T17:44:12Z","snapshot_observed_at":"2026-08-07T10:19:21.034875Z","submitted_at":"2025-06-05T17:44:12Z","title":"EOC-Bench: Can MLLMs Identify, Recall, and Forecast Objects in an Egocentric World?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:09.538863Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.05287"},"observation_digest":"sha256:6d7fc37ddf79bd3ac865d3c49bfd2e68f918cfad4096d1c36bf7804cf12d075d","observation_id":"e8315937-1c4c-4eed-a4d5-020faa7412bf","resolution":{"observed_at":"2026-08-07T10:29:09.538863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:47:07.697677Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09634","last_updated":"2025-06-11T11:46:57Z","snapshot_observed_at":"2026-08-07T04:41:01.082936Z","submitted_at":"2025-06-11T11:46:57Z","title":"HSENet: Hybrid Spatial Encoding Network for 3D Medical Vision-Language Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:07.697677Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.09634"},"observation_digest":"sha256:36a0776f71187efcd95872270ed6fbf82e867670462b4dcc9ff50c3b057de29a","observation_id":"4adaa931-5207-495e-bbd1-7f0ca55cb3db","resolution":{"observed_at":"2026-08-07T04:47:07.697677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T04:08:46.824918Z","title":"Tokenpacker: Efficient visual projector for multimodal llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11515","last_updated":"2025-06-13T07:16:41Z","snapshot_observed_at":"2026-08-07T08:51:22.512034Z","submitted_at":"2025-06-13T07:16:41Z","title":"Manager: Aggregating Insights from Unimodal Experts in Two-Tower VLMs and MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T04:08:46.824918Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.11515"},"observation_digest":"sha256:7dc6b9d10f5f74c8afe26c49f8440d4393b9a6045dfcde8db84c738a5594d9d6","observation_id":"c62664f3-9f31-4c76-a0de-2a28e1bfcca7","resolution":{"observed_at":"2026-08-07T04:08:46.824918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T00:48:30.416053Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-07T00:40:26.860337Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.416053Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ce2d387b58ca1f8bbdd3543cdaacb9ba95f53211c75f4418070b8b4529cac7be","observation_id":"4294a87b-37ca-4dd7-8684-3793d217ceef","resolution":{"observed_at":"2026-08-07T00:48:30.416053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T00:40:25.023913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13045","last_updated":"2025-08-24T10:01:04Z","snapshot_observed_at":"2026-08-07T00:34:58.147767Z","submitted_at":"2025-06-16T02:27:25Z","title":"Continual Learning for Generative AI: From LLMs to MLLMs and Beyond","version":4},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:25.023913Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.13045"},"observation_digest":"sha256:93b843588cb3c50c80f403eaf2bab687ba81864bdb78bf3675a3fa3684379ce9","observation_id":"ede358af-656a-4c9c-a204-21158acab1c5","resolution":{"observed_at":"2026-08-07T00:40:25.023913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T20:38:29.543299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02279","last_updated":"2025-07-03T03:42:54Z","snapshot_observed_at":"2026-08-06T20:30:50.367871Z","submitted_at":"2025-07-03T03:42:54Z","title":"LaCo: Efficient Layer-wise Compression of Visual Tokens for Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:38:29.543299Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.02279"},"observation_digest":"sha256:67e75680a22feece7025c808dd724b0584de598a487b0a139f6f45a719559ecb","observation_id":"c934db64-3e50-42a6-b795-2596f8f744e4","resolution":{"observed_at":"2026-08-06T20:38:29.543299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T19:10:00.242206Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07135","last_updated":"2025-07-08T23:02:10Z","snapshot_observed_at":"2026-08-07T06:31:49.166011Z","submitted_at":"2025-07-08T23:02:10Z","title":"FACap: A Large-scale Fashion Dataset for Fine-grained Composed Image Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:10:00.242206Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.07135"},"observation_digest":"sha256:67c8269256f89b17565c9060a6e529472069731ec84760542a1ae5d554d42920","observation_id":"bb2fa175-544f-4b44-8abd-a3127afaa569","resolution":{"observed_at":"2026-08-06T19:10:00.242206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T18:03:01.298449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09334","last_updated":"2025-07-12T16:29:02Z","snapshot_observed_at":"2026-08-06T17:56:14.969465Z","submitted_at":"2025-07-12T16:29:02Z","title":"Fast3D: Accelerating 3D Multi-modal Large Language Models for Efficient 3D Scene Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:03:01.298449Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.09334"},"observation_digest":"sha256:4b12491123ffcdedec6ae79361500bae520fc5274dee593e0ba515b38d7e4b2a","observation_id":"0c424190-ddff-486c-a6ef-16aaf8b4e4ef","resolution":{"observed_at":"2026-08-06T18:03:01.298449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T17:38:16.589632Z","title":"arXiv:2407.02392 (2024) 1, 2, 3, 10","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-07T08:25:37.888948Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:16.589632Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:ea95fb6fe080dcf812606ecdf07053613a06bf961460a76bd1acde580d3968dd","observation_id":"3243f840-cfe4-4a19-8f2d-3f79e8bfccb5","resolution":{"observed_at":"2026-08-06T17:38:16.589632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T16:43:51.265156Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12883","last_updated":"2025-08-13T05:27:53Z","snapshot_observed_at":"2026-08-06T16:33:30.327495Z","submitted_at":"2025-07-17T08:09:31Z","title":"HRSeg: High-Resolution Visual Perception and Enhancement for Reasoning Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:43:51.265156Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.12883"},"observation_digest":"sha256:951acd422ee26e82aa71ae81ba2bf2f35700847c1f1823e9fcd28596067c4027","observation_id":"d3e74dd7-8293-4ec6-9204-f21aaa904a8f","resolution":{"observed_at":"2026-08-06T16:43:51.265156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T12:31:26.074772Z","title":"Tokenpacker: Efficient visual projector for multi- modal llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21741","last_updated":"2025-07-29T12:17:46Z","snapshot_observed_at":"2026-08-06T12:31:24.449021Z","submitted_at":"2025-07-29T12:17:46Z","title":"MAGE: Multimodal Alignment and Generation Enhancement via Bridging Visual and Semantic Spaces","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:31:26.074772Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2507.21741"},"observation_digest":"sha256:d511fbd0b4d920dfdac6b08ff9c63beb937fc99773e0bf682ec950a294de22f8","observation_id":"b04a3492-ffc0-4989-92c4-271b99e7bb8a","resolution":{"observed_at":"2026-08-06T12:31:26.074772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-06T05:51:15.952781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01236","last_updated":"2025-08-02T07:22:08Z","snapshot_observed_at":"2026-08-07T10:22:34.344208Z","submitted_at":"2025-08-02T07:22:08Z","title":"Mitigating Information Loss under High Pruning Rates for Efficient Large Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:51:15.952781Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2508.01236"},"observation_digest":"sha256:330b512dddf2303d479d6ee2a63cb8c9fb774868a80dff6ea4f14d7b04557e15","observation_id":"1a3c9763-f343-4d6b-95d7-997527b62566","resolution":{"observed_at":"2026-08-06T05:51:15.952781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-05T14:42:32.675460Z","title":"Tokenpacker: Efficient visual projector for multimodal llm.arXiv preprint arXiv:2407.02392, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21046","last_updated":"2026-05-27T08:39:30Z","snapshot_observed_at":"2026-08-05T14:42:31.889948Z","submitted_at":"2025-08-28T17:50:58Z","title":"CogVLA: Cognition-Aligned Vision-Language-Action Model via Instruction-Driven Routing & Sparsification","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:42:32.675460Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2508.21046"},"observation_digest":"sha256:03f3f6f57ffb9552530eb3f99df9d556557abc38a43faee7bf39dbe0843fdb5d","observation_id":"9edf9c59-0678-425a-9243-243392fd084d","resolution":{"observed_at":"2026-08-05T14:42:32.675460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-05T13:05:54.422800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00969","last_updated":"2025-09-09T03:59:05Z","snapshot_observed_at":"2026-08-07T10:22:31.806249Z","submitted_at":"2025-08-31T19:27:29Z","title":"Seeing More, Saying More: Lightweight Language Experts are Dynamic Video Token Compressors","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T13:05:54.422800Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2509.00969"},"observation_digest":"sha256:29177fa094cfe02e0d65bf035c89dd5d7c51ed9c8b4f996fbcef609d4929efbe","observation_id":"4b131883-97a4-4f14-97af-e2abeb8c3d79","resolution":{"observed_at":"2026-08-05T13:05:54.422800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":"2407.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-01T10:15:44.617819Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"94acb309-ae67-47f3-96f5-f72bad1cb617","year":2024},"citing_paper":{"arxiv_id":"2511.06754","last_updated":"2026-05-06T07:00:01Z","snapshot_observed_at":"2026-07-29T01:21:11.279990Z","submitted_at":"2025-11-10T06:33:44Z","title":"SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T00:22:41.611893Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2511.06754"},"observation_digest":"sha256:34fbefdf60a6118aaf42c49cd29fa569fe5b0bd359495f90d538fbe5ab21caff","observation_id":"8d937da5-6184-48f7-91e4-6eaf389f73b2","resolution":{"observed_at":"2026-05-18T00:25:33.013951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":"2407.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-01T10:15:44.617819Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"94acb309-ae67-47f3-96f5-f72bad1cb617","year":2024},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:444875937c149b206a7aad04fd6797223bd31f7edbca3de9d8b6e9ba7662c305","observation_id":"730fc652-2479-4f49-9878-86f56d5b5466","resolution":{"observed_at":"2026-05-11T07:00:59.210581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":"2407.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-01T10:15:44.617819Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"94acb309-ae67-47f3-96f5-f72bad1cb617","year":2024},"citing_paper":{"arxiv_id":"2605.30126","last_updated":"2026-05-28T15:57:31Z","snapshot_observed_at":"2026-08-03T03:31:55.994242Z","submitted_at":"2026-05-28T15:57:31Z","title":"PARCEL: Pool-Anchored Resampling with Conditioned Elastic Queries for Efficient Vision-Language Understanding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-29T08:13:42.526597Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2605.30126"},"observation_digest":"sha256:9a7334c53d0cde3a0b1351777b68cb63fa0e9285366b6c7db96d6a7cb2be07f7","observation_id":"de47aec6-9bef-40d4-9786-bfe0e2b88f70","resolution":{"observed_at":"2026-06-29T08:23:15.864498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":"2407.02392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-01T10:15:44.617819Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":"94acb309-ae67-47f3-96f5-f72bad1cb617","year":2024},"citing_paper":{"arxiv_id":"2606.31383","last_updated":"2026-06-30T09:11:50Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:11:50Z","title":"MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T05:41:04.184461Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2606.31383"},"observation_digest":"sha256:cfcbef2a6a9bc17709ceac26328a503fbafbcd4ee7897328e3e6b38d6ac2b444","observation_id":"2500fc84-b94d-418c-a669-5923dcef4800","resolution":{"observed_at":"2026-07-01T10:15:44.619104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-31T15:16:35.532712Z","title":"To- kenPacker: Efficient visual projector for multimodal LLM.arXiv preprint arXiv:2407.02392, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-03T02:41:13.403175Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.532712Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d8ce17af8c9714e1623cfe4b66ed6a69f0815b215182fbd373defb44054fc888","observation_id":"8f953d7f-c32b-4170-910c-9dc353963321","resolution":{"observed_at":"2026-07-31T15:16:35.532712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-04T23:46:51.568021Z","title":"International Journal of Computer Vision (IJCV) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01644","last_updated":"2026-08-03T03:27:46Z","snapshot_observed_at":"2026-08-06T23:32:52.420159Z","submitted_at":"2026-08-03T03:27:46Z","title":"CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T23:46:51.568021Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.01644"},"observation_digest":"sha256:318aadc9bd8432f9a4f259a0fc237ef0d32d6cd958298829d64b29280a89ee12","observation_id":"029a34b8-1856-4299-8a32-a5378955ea5a","resolution":{"observed_at":"2026-08-04T23:46:51.568021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-05T15:19:02.805044Z","title":"TokenPacker : Efficient visual projector for multimodal LLM","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03649","last_updated":"2026-08-04T13:33:11Z","snapshot_observed_at":"2026-08-07T15:35:05.754131Z","submitted_at":"2026-08-04T13:33:11Z","title":"When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:02.805044Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2608.03649"},"observation_digest":"sha256:75b62e163fa5b6c25b051a48afbedf14f6c747ad67aac8af7a8af6347a2a80a7","observation_id":"a842a616-3f4c-4e81-9abb-82e1759158ba","resolution":{"observed_at":"2026-08-05T15:19:02.805044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.02392/citation-record","integrity":"/paper/2407.02392/integrity","json":"/paper/2407.02392/citation-record.json","paper":"/paper/2407.02392"},"outbound":[],"paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2407.02392."}