{"as_of":"2026-08-16T19:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59e9c17cec40b22d7ecf2218e6b5325cc3315eed1648ec9ac172f9a407de6772","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:05:05.400221Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:20:19.874172Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13178","snapshot_observed_at":"2026-07-11T16:32:55.757864Z","title":"arXiv preprint arXiv:2605.13178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-14T18:53:07.284837Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-11T16:32:55.757864Z"},"links":{"cited_paper":"/paper/2605.13178","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:1d68b63c291ab6060cf45ca0602328cabfd3aaee9e6f95d935e7a17c81581efb","observation_id":"3be9d4dd-d3a8-486b-baca-99b17db2de85","resolution":{"observed_at":"2026-07-11T16:32:55.757864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13178","snapshot_observed_at":"2026-07-14T16:20:19.874172Z","title":"arXiv preprint arXiv:2605.13178 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04605","last_updated":"2026-07-13T07:13:49Z","snapshot_observed_at":"2026-08-14T18:53:07.284837Z","submitted_at":"2026-07-06T02:19:11Z","title":"Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-14T16:20:19.874172Z"},"links":{"cited_paper":"/paper/2605.13178","citing_paper":"/paper/2607.04605"},"observation_digest":"sha256:a7d5a476eb3a2bdce5bb07dba05a28bac691dcacd27caaf75d0857d6915dda4e","observation_id":"ba733c62-eea7-47ec-ae6c-25dc6e4a0a15","resolution":{"observed_at":"2026-07-14T16:20:19.874172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.13178/citation-record","integrity":"/paper/2605.13178/integrity","json":"/paper/2605.13178/citation-record.json","paper":"/paper/2605.13178"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:6457950d46984c0339cf4a6435d7537ed1fa507bb8dc9dfe59f63df2aa4452a0","observation_id":"51ea143e-6bff-494f-961b-860080fa0f8e","resolution":{"observed_at":"2026-07-01T14:15:47.684821Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:0511fc622f3b8202d0ca40b8c557a7589654bbbbe8e536dacd9081486c3b20bb","observation_id":"34b6cc85-005d-4c4f-ae20-c644ba93b500","resolution":{"observed_at":"2026-07-01T14:15:47.671143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:15.620681+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:93bb86bafd0052fc26f81e2ec278b37a776071279dde33482bb03312688d18c1","observation_id":"508c962d-33c4-473a-aaea-368a9c79a308","resolution":{"observed_at":"2026-07-01T14:15:47.687077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:bcc66127f59869f1ba59e6911b6c7e12c4d966ee2e5d3757fccc161d0849ac84","observation_id":"103c0351-9261-4bfa-bc3c-2eae9b239183","resolution":{"observed_at":"2026-07-01T14:15:47.682740Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.991193Z","title":null,"venue":null,"work_id":"b2c76a19-669e-4e8c-91c6-aa3910ae428a","year":2024},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:84aaf9980e07529458070c68e22bae52ebcfce50b17897192d063146c1e1fbe9","observation_id":"613bfecb-4ba3-4020-9bf0-e870ac82da89","resolution":{"observed_at":"2026-07-07T15:13:53.992380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:154b04f070db67c43717f058b18921ad8553917c2f7f96e124bd585e32bf124a","observation_id":"88d195e1-dfef-4328-843b-89d66ac1aac2","resolution":{"observed_at":"2026-07-01T14:15:47.678231Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":"2403.08295","doi":"10.48550/arxiv.2403.08295","metadata_source":"pith","pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma: Open Models Based on Gemini Research and Technology","venue":"cs.CL","work_id":"a9ea2870-df28-40b8-a9e0-a7e9a116f793","year":2024},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:c6a5cf943086af7f3bd94a1e4e2459012fa8f7aa75b07c0c1ed918085ee44a0d","observation_id":"4e26ab1f-f3a4-4cbb-a923-b9356b8d9393","resolution":{"observed_at":"2026-07-01T14:15:47.680439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-10T22:08:13.221222+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T22:08:13.221222+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:e91e8c76b9acc0ef6746c46c4b3ca245f641d428dcda05326f087471c2787ff4","observation_id":"437c3db6-78de-4789-b8b0-00e141a90be5","resolution":{"observed_at":"2026-07-01T14:15:47.675961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:e1d9ef28e548d45444a22a9a88eb7454ed7302653eab09f756a8f6e6a9e84277","observation_id":"3beae1b5-cac5-4c86-878c-1eb4a8fe52ae","resolution":{"observed_at":"2026-07-01T14:15:47.673691Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.987401Z","title":"Dataset We conduct experiments with LiteLVLM on 6 widely used benchmarks, including 3 referring expression segmentation datasets and3referring video object segmentation datasets","venue":null,"work_id":"1a9b7a6c-295d-4f7e-baac-b5159cdf9cc3","year":2024},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:9336769fbf5857847361140742b5fd3fbab09248dbca25109094ec2dc2ee28dc","observation_id":"d06879aa-db81-4f8c-be4b-a9562f98743a","resolution":{"observed_at":"2026-07-07T15:13:53.988727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.985674Z","title":"left/right","venue":null,"work_id":"14afd8f5-3473-40df-8ba5-000e17873d2f","year":2014},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:35b417f3484635999b4516e8e5f260cd9c499d2b65848204f156e19dac40d237","observation_id":"bab79e1b-9888-40af-a4b7-4b6abf133f79","resolution":{"observed_at":"2026-07-07T15:13:53.986798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.982146Z","title":"As shown in Table 7, LiteLVLM maintains its performance with only a 0.2% drop while pruning 65.9% of the total visual tokens (192 tokens)","venue":null,"work_id":"2b5aca5b-cbf3-4588-a810-ff5608c8092d","year":2017},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:75317b1a4a05777a0f6b4087ca601d90a4b9209e5b311b5cd796010be56b23b1","observation_id":"7390316f-ad6f-4c4a-a40c-04ab86994878","resolution":{"observed_at":"2026-07-07T15:13:53.983467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.978998Z","title":null,"venue":null,"work_id":"6eab1bd7-e9ca-4090-95a1-e92097bd8267","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:1955bde1b2801bcb445fa8897e79e00246054e3bcb718873d699e685f3042aab","observation_id":"25c55b4a-dba2-46c2-8911-135d1022088d","resolution":{"observed_at":"2026-07-07T15:13:53.980027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.989305Z","title":"MetaCLIP builds upon CLIP by scaling up the pretraining data and improving data quality","venue":null,"work_id":"72d88bdd-23a3-4d9b-bfbf-185f0c2f7ffd","year":2023},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:6bf7d97caa80246a2d8e315e853762a03556297b51964cc49d406898e6de7591","observation_id":"736e1e67-25a1-430e-9007-d67df00e89d2","resolution":{"observed_at":"2026-07-07T15:13:53.990598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.980567Z","title":null,"venue":null,"work_id":"8660006c-2a1b-4656-aa98-3480243f0040","year":2026},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:db49be58373e71a995cc996a8a46b970b8eb44691b88fbd0e92985164c60b61c","observation_id":"bed0136a-5d33-4174-bb79-2e7902bda128","resolution":{"observed_at":"2026-07-07T15:13:53.981576Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T15:13:53.983992Z","title":"Here, we employ LiteLVLM‡, an enhanced version that primarily uses context-aware tokens","venue":null,"work_id":"d01d2f0e-fab5-4757-8f48-8bd5f2105b4e","year":2025},"citing_paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T22:05:05.400221Z"},"links":{"citing_paper":"/paper/2605.13178"},"observation_digest":"sha256:5c95373dc9a85c4a87eb4c6292215ceebc4bcb6b38c5eab6356ba0edf91510ff","observation_id":"71b7b7ea-b0ff-4968-bff8-2698f41b8574","resolution":{"observed_at":"2026-07-07T15:13:53.985129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.13178","last_updated":"2026-06-01T16:00:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T08:14:48.642944Z","submitted_at":"2026-05-13T08:40:40Z","title":"CLIP Tricks You: Training-free Token Pruning for Efficient Pixel Grounding in Large VIsion-Language Models"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":2,"verified_exact":5,"verified_fuzzy":5},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 2 inbound Pith citation observations for arXiv:2605.13178."}