{"as_of":"2026-08-15T21:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e42e6c552171f9d5845ebc83ae5e1769c2a18db50027dd5b1498a2f5b0139a3f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:35:01.461405Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07627/citation-record","integrity":"/paper/2506.07627/integrity","json":"/paper/2506.07627/citation-record.json","paper":"/paper/2506.07627"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.234998Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.234998Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:c93c68742890ae58de0f7c96ba42b0983a735109ff612894a7517a255865eb25","observation_id":"238e8549-31f3-4750-8115-54b5a1062232","resolution":{"observed_at":"2026-08-07T05:35:01.234998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.520599Z","title":"https://www.anthropic.com/news/claude-3-5- sonnet (2024), https://www.anthropic.com/news/claude-3-5-sonnet","venue":null,"work_id":"ee7b373c-e3cf-4e36-b0e7-5b533a017806","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.241212Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:a19276ef4c5ea4aaa8cf0692632500e7c84c874ac62339c1934b5f4014e14e00","observation_id":"5e5cb891-9051-49f5-b995-e33718dc633e","resolution":{"observed_at":"2026-08-07T05:35:02.525374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.246319Z","title":"In: Proceedings of the IEEE international confer- ence on computer vision","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.246319Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:50ac45279d04d4ee4a6c45bc292c4d3ef5f33945bb7f86620f9f4c129808a542","observation_id":"88cf8b61-97d3-4317-b1e4-5de1f45be92d","resolution":{"observed_at":"2026-08-07T05:35:01.246319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T05:35:01.251547Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.251547Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:40482024640a4354a25be1c590380c1e60cc4e0e1903d7845d36dad2daec37a7","observation_id":"21f2acbb-ed24-48fb-b1ff-748a7d2783e3","resolution":{"observed_at":"2026-08-07T05:35:01.251547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11514","last_updated":"2025-04-15T13:49:17Z","snapshot_observed_at":"2026-08-13T21:22:06.704756Z","submitted_at":"2025-04-15T13:49:17Z","title":"Enhancing Autonomous Driving Systems with On-Board Deployed Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11514","snapshot_observed_at":"2026-08-07T05:35:01.258244Z","title":"arXiv preprint arXiv:2504.11514 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.258244Z"},"links":{"cited_paper":"/paper/2504.11514","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:358fe0b71a442d8140797d77cf0843f4018e57622c1261ff70b5339ce9018899","observation_id":"9327af28-9155-47dd-bfd3-ecd6d0970fad","resolution":{"observed_at":"2026-08-07T05:35:01.258244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.482466Z","title":"Nature398(6725), 334–338 (1999)","venue":null,"work_id":"813af69b-82f3-4cf8-8fea-3df1ae1875f6","year":1999},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.263319Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:82befa8c45326d7ffd47af6be7ab404620d579b024a615beb0789636ce4a467b","observation_id":"03517438-d286-418f-b5a7-93609085266e","resolution":{"observed_at":"2026-08-07T05:35:02.490169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.463234Z","title":"In: Proceedings of the The 31st British Machine Vision Virtual Conference","venue":null,"work_id":"444a6339-ccf8-4b02-8716-63e6b6da19e2","year":2020},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.270516Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:1519b5910d5312a76c73da1fc2c003536e67ec4190db66415511bf959703243a","observation_id":"d332590e-6f71-4fa2-ac1b-968dfd0997d6","resolution":{"observed_at":"2026-08-07T05:35:02.468542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11960","last_updated":"2024-02-19T09:04:30Z","snapshot_observed_at":"2026-08-13T04:15:38.211856Z","submitted_at":"2024-02-19T09:04:30Z","title":"DB-LLM: Accurate Dual-Binarization for Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11960","snapshot_observed_at":"2026-08-07T05:35:01.276118Z","title":"arXiv preprint arXiv:2402.11960 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.276118Z"},"links":{"cited_paper":"/paper/2402.11960","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:d2e93104e5dc4be44254ece75e74fa0de5b726f3668140b5d220d9173e01e08b","observation_id":"1848e84a-a530-4753-9fdb-3e9f2eba6f7d","resolution":{"observed_at":"2026-08-07T05:35:01.276118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.444795Z","title":"In: 2022 International Joint Conference on Neural Networks (IJCNN)","venue":null,"work_id":"3f65637c-dc55-4f85-a7a0-b59ec90d4a4e","year":2022},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.281446Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:117d5470f57242cff87ed346fd14f85af6e361702882b91babaee91086d42371","observation_id":"33529c23-09a6-4e1e-bf93-8495434b55df","resolution":{"observed_at":"2026-08-07T05:35:02.450449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T05:35:01.286141Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.286141Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:852a45d8ce65febe9fdb77eb34a2778c74a60b019cc9c828581fc63a6c2623e8","observation_id":"f1a869e6-b29d-4c01-85f9-c74f46883dba","resolution":{"observed_at":"2026-08-07T05:35:01.286141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.291600Z","title":"IEEE transactions on pattern analysis and machine intelligence 44(1), 154–180 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.291600Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:cc81eaccf67a396188077814fe3f61fd5f3399cb3fb0142425cd03ce42dee00b","observation_id":"b104591f-5858-4302-8ce3-16e3f6f2997a","resolution":{"observed_at":"2026-08-07T05:35:01.291600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06677","last_updated":"2023-12-04T07:51:58Z","snapshot_observed_at":"2026-08-14T05:06:10.242676Z","submitted_at":"2023-12-04T07:51:58Z","title":"Intelligent Virtual Assistants with LLM-based Process Automation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06677","snapshot_observed_at":"2026-08-07T05:35:01.296304Z","title":"arXiv preprint arXiv:2312.06677 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.296304Z"},"links":{"cited_paper":"/paper/2312.06677","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:b98dfdff3cb33649f6ce8fcf77d6756b133315ccaa512b1a873c58c45f20ee69","observation_id":"c4fccd18-3452-4932-8dbb-5ba0fe2debdc","resolution":{"observed_at":"2026-08-07T05:35:01.296304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:35:01.301479Z","title":"arXiv preprint arXiv:2501.12948 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.301479Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:2336c28fd7218b2f357c5eedeee6435fdc5ce46b84a50def2ae873d071877772","observation_id":"b98b18b4-456d-4ded-a78b-8bffc25d3026","resolution":{"observed_at":"2026-08-07T05:35:01.301479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T05:35:01.306179Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.306179Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:fb7cd2b187b84f0e64171f5e343d446c6eea551680789090189c2e0f53215679","observation_id":"09a0e717-34f9-4ede-8d0e-d02ee2bae432","resolution":{"observed_at":"2026-08-07T05:35:01.306179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19334","last_updated":"2024-06-09T11:34:12Z","snapshot_observed_at":"2026-08-15T00:31:14.165347Z","submitted_at":"2024-05-29T17:59:20Z","title":"LLMs Meet Multimodal Generation and Editing: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19334","snapshot_observed_at":"2026-08-07T05:35:01.311183Z","title":"arXiv preprint arXiv:2405.19334 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.311183Z"},"links":{"cited_paper":"/paper/2405.19334","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:56d3f9897c393645fc2c29af78815a41133ce9cec2e44d1ebedec819eaf2c181","observation_id":"3d300fcf-0ad1-464f-8958-89a561b1af96","resolution":{"observed_at":"2026-08-07T05:35:01.311183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04291","last_updated":"2024-05-15T13:55:12Z","snapshot_observed_at":"2026-08-13T15:50:33.443969Z","submitted_at":"2024-02-06T09:26:34Z","title":"BiLLM: Pushing the Limit of Post-Training Quantization for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04291","snapshot_observed_at":"2026-08-07T05:35:01.316009Z","title":"arXiv preprint arXiv:2402.04291 (2024) 14 H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.316009Z"},"links":{"cited_paper":"/paper/2402.04291","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:9eee8e6be3ea247c5992959a32f50ad2c322351a83710e9c488c84318c791f17","observation_id":"e91f1c1e-993e-43c3-b43b-fd4abe337774","resolution":{"observed_at":"2026-08-07T05:35:01.316009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14917","last_updated":"2025-05-25T08:58:37Z","snapshot_observed_at":"2026-08-14T20:23:21.459561Z","submitted_at":"2024-05-23T16:21:48Z","title":"SliM-LLM: Salience-Driven Mixed-Precision Quantization for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14917","snapshot_observed_at":"2026-08-07T05:35:01.321095Z","title":"arXiv preprint arXiv:2405.14917 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.321095Z"},"links":{"cited_paper":"/paper/2405.14917","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:a2effeba5641ff22d13d8fa033f2cbd8776132de15656fe7e8711fbc518ce705","observation_id":"7aed8f98-a300-4a80-b2d7-063855fe7554","resolution":{"observed_at":"2026-08-07T05:35:01.321095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.410998Z","title":"Visual Intelligence2(1), 36 (2024)","venue":null,"work_id":"c8986916-9ef7-4fff-9b75-0ecbd5db3f08","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.326036Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:e53a91effdff26a432b5dc9b1e34ae7a5bda79f34828d5028653f289461f8e8b","observation_id":"a050c830-4cd8-4f3f-b4ee-977be0ca1848","resolution":{"observed_at":"2026-08-07T05:35:02.419164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:35:01.331355Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.331355Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:becc631a0ed484b8f8620ec48c97d4d0cf8c945e54008356482a83cd906cbbcc","observation_id":"3a4d2fbf-9762-4071-accc-3b677cdf2312","resolution":{"observed_at":"2026-08-07T05:35:01.331355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.390660Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"e6d4d16b-99e6-492e-9721-49c53ec4ddc0","year":2021},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.336967Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:543de4b89c78624c606d1878739b0a4611b419b10e292b2abc2fd4f66152495c","observation_id":"e2bb8086-af9b-43ed-9dd5-ab675095abee","resolution":{"observed_at":"2026-08-07T05:35:02.396126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15639","last_updated":"2023-02-23T19:14:52Z","snapshot_observed_at":"2026-08-15T10:02:40.476668Z","submitted_at":"2022-09-30T17:59:52Z","title":"F-VLM: Open-Vocabulary Object Detection upon Frozen Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15639","snapshot_observed_at":"2026-08-07T05:35:01.342025Z","title":"arXiv preprint arXiv:2209.15639 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.342025Z"},"links":{"cited_paper":"/paper/2209.15639","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:674785ef03ee9cf3b259961931fa692bb37f85942521e9eac31de0f168e8a7b4","observation_id":"0ca67499-01c0-4d60-bf2d-62371bd9eb94","resolution":{"observed_at":"2026-08-07T05:35:01.342025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.369620Z","title":null,"venue":null,"work_id":"82589706-29ed-49b5-b087-f920c1d88bc3","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.347177Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:79796b5829fab832b0c22b0d6b08edf945426bd92d24512ba51bbb3918c17b47","observation_id":"a1858eee-b590-4f4d-ae0d-baf374bce5ec","resolution":{"observed_at":"2026-08-07T05:35:02.375341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.351916Z","title":"arXiv preprint arXiv:2410.03129 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.351916Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:8b5f918e4980ff69a42d599595e3eb30aa5201c3d0482d7eaffd7e3101410e05","observation_id":"75cc4429-f30f-4c2a-9067-329b63ced489","resolution":{"observed_at":"2026-08-07T05:35:01.351916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-07T05:35:01.356624Z","title":"arXiv preprint arXiv:2412.19437 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.356624Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:5fab1d581b26595cff433b57e6dcc96774c17ab4ef0dc26213b1e823eafff500","observation_id":"6d642707-eef9-459d-b6f2-403f99a1f71d","resolution":{"observed_at":"2026-08-07T05:35:01.356624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.361988Z","title":"Advances in neural information processing systems36, 34892–34916 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.361988Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:45b9bd66316ce17d8e29196f6277c801e0b98e1bf5712bd7e16804444b4db216","observation_id":"918df530-2e50-450b-bad2-41e5f366db7d","resolution":{"observed_at":"2026-08-07T05:35:01.361988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00832","last_updated":"2024-12-01T14:38:40Z","snapshot_observed_at":"2026-08-15T05:47:33.287055Z","submitted_at":"2024-12-01T14:38:40Z","title":"EventGPT: Event Stream Understanding with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00832","snapshot_observed_at":"2026-08-07T05:35:01.366536Z","title":"arXiv preprint arXiv:2412.00832 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.366536Z"},"links":{"cited_paper":"/paper/2412.00832","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:1bb8abd0b617f53f89989d8daad1efce0c0b598874b3335077088b4323ad27c7","observation_id":"e341bfd4-a294-4028-a135-048efe39d61c","resolution":{"observed_at":"2026-08-07T05:35:01.366536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.372059Z","title":"Advances in neural information processing systems36, 21702–21720 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.372059Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:754806894c193eb8cab09b67c65b727ce041c72a01451ddb5bc11bd2b076b43c","observation_id":"17592091-4af9-41eb-84d5-a21f9f6973a5","resolution":{"observed_at":"2026-08-07T05:35:01.372059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.327505Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"ad6b45c7-ed8f-4b79-b507-949fad9513a7","year":2020},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.377311Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:dc39aafab214233ae5be2ce0f31278306b011221536887644c305e55dced45e7","observation_id":"05c4d6f4-90c7-4358-9830-f20ecdbd38c4","resolution":{"observed_at":"2026-08-07T05:35:02.333231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.305547Z","title":"https://ai","venue":null,"work_id":"99cac225-b22c-4a23-b7d7-64efcf7503b6","year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.382717Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:67e80b3c77db521baa1729ea5a5d55b18b9eb687920fc805692ba5bc5c91be67","observation_id":"0c1a0c11-5f7d-4b37-9d80-c38ce025eff9","resolution":{"observed_at":"2026-08-07T05:35:02.313546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.285568Z","title":"https://github.com/MrYxJ/calculate-flops.pytorch (2024), https://github.com/MrYxJ/calculate-flops.pytorch","venue":null,"work_id":"4fdd1a17-c34e-481c-be00-715a24e9ed94","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.389774Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:68fcda3c0e2ed6e7671f9dc1eeed7c71e5acbb87096ffd01a4816f8292b41ca0","observation_id":"33673877-8f7c-4cfa-b66b-08e02b3527bf","resolution":{"observed_at":"2026-08-07T05:35:02.291633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.395346Z","title":"The International journal of robotics research36(2), 142–149 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.395346Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:a0d76aa341d47a736a6a96b61cc142d1df191cc9f341cfabf6d76bb2ef36c3b9","observation_id":"60a3cf18-fd5c-4ff8-a36a-9935e8c0138c","resolution":{"observed_at":"2026-08-07T05:35:01.395346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05445","last_updated":"2024-05-27T09:20:35Z","snapshot_observed_at":"2026-08-13T04:23:39.904990Z","submitted_at":"2024-02-08T06:53:31Z","title":"Accurate LoRA-Finetuning Quantization of LLMs via Information Retention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05445","snapshot_observed_at":"2026-08-07T05:35:01.400901Z","title":"arXiv preprint arXiv:2402.05445 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.400901Z"},"links":{"cited_paper":"/paper/2402.05445","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:c2b66929c7d5e12590dc52ad2376d2c7f660083c65441971e09a6663f0c5ba21","observation_id":"6d45665f-d944-4f69-9f20-0198a453f600","resolution":{"observed_at":"2026-08-07T05:35:01.400901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.254221Z","title":"In: International conference on machine learning","venue":null,"work_id":"bdc4f13a-b24c-44ca-abc3-ca7fe96dddea","year":2021},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.405941Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:cb04cf29e4cde96c5993137e7002a89da838f5dd942cc5c06378cacee7f4906c","observation_id":"e4cfcd43-a019-49c1-a033-7c2d35c160be","resolution":{"observed_at":"2026-08-07T05:35:02.260415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.236234Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"9424ece5-e5a3-4605-b249-f5d170abf62a","year":2022},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.411197Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:89febbfa3cc20de4033de5ed1ebc6a1507fef90e5748d513294f802751a1976b","observation_id":"66c33baa-1e3d-4504-a05f-a3f91f8130e0","resolution":{"observed_at":"2026-08-07T05:35:02.241815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:01.416176Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.416176Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:898a50630c1cdba3677fffe73c322c8c788a20d2806c3a3f6cfd1e89a8152b16","observation_id":"ce0d03ad-91b0-4163-b4c9-ae1e88d58257","resolution":{"observed_at":"2026-08-07T05:35:01.416176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-07T05:35:01.421359Z","title":"arXiv preprint arXiv:2306.11695 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.421359Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:013edce6e8d7f190aa951fd975e256740c0f1ff909513831442c9c920a736f9a","observation_id":"453602af-4921-43d4-972e-da4726f87b3c","resolution":{"observed_at":"2026-08-07T05:35:01.421359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:35:01.426484Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.426484Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:fa2bff54410ecfc63fe988dd6caae322c7ff1bcd837bd1195d85530da5701c68","observation_id":"d1ae693a-5c14-4b4b-b16f-cedb66958f05","resolution":{"observed_at":"2026-08-07T05:35:01.426484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:35:01.431300Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.431300Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:f44d2484dd95374fee0b3ade19f6bc46163c368d3b2995eb77ff7cfe0f9a06aa","observation_id":"2219eb76-079c-412e-b238-72a677e3234f","resolution":{"observed_at":"2026-08-07T05:35:01.431300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.204315Z","title":"https://x.ai/blog/grok-2 (2024), https://x.ai/blog/grok-2","venue":null,"work_id":"1884276e-e465-4ac5-855a-19fcd565b324","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.436167Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:1f5d561a223969b75d71eb7c96dfcad6f40e0d206987024156192eb43609fa47","observation_id":"4e049a2c-1bb5-408a-b625-141990d53c0c","resolution":{"observed_at":"2026-08-07T05:35:02.210265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-10T17:26:33.432994Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-07T05:35:01.440918Z","title":"arXiv preprint arXiv:2402.13116 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.440918Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:32beacf1b3bbcf1ce4535d4c14e7430bab10a3ebb66162a8ee5f16a60378714d","observation_id":"0d71a1ad-c254-48dd-94be-6a0e74c7bc97","resolution":{"observed_at":"2026-08-07T05:35:01.440918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:35:01.445789Z","title":"arXiv preprint arXiv:2505.09388 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.445789Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:6dcd76433de545e7c32b8de4b1e09262a40fd1b9ef0c08c84fdf8b503a647182","observation_id":"368c729f-f95b-4e34-9f02-0663165b7530","resolution":{"observed_at":"2026-08-07T05:35:01.445789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21352","last_updated":"2024-10-31T06:01:26Z","snapshot_observed_at":"2026-08-12T22:13:44.836292Z","submitted_at":"2024-10-28T14:45:01Z","title":"LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment","version":2},"cited_work":{"arxiv_id":"2410.21352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21352","snapshot_observed_at":"2026-08-07T05:35:01.544324Z","title":"LLMCBench: Benchmarking Large Language Model Compression for Efficient Deployment","venue":"cs.CL","work_id":"12c80d94-3712-40a2-a28e-765b298cdd25","year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.450581Z"},"links":{"cited_paper":"/paper/2410.21352","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:51a84e3b092bbda2fc1ba88d8ca908850568363b0f1e01c79ce7faf272037121","observation_id":"7bb93c8a-aa06-44ee-a5d2-5247173e11e6","resolution":{"observed_at":"2026-08-07T05:35:01.553729Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:35:02.186416Z","title":"In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":"313bd2a7-838d-4521-81ba-b12bbba829ec","year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.455318Z"},"links":{"citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:c6581c4123d0e700bd39eaefdb17e5215fe12cf81111af981de1a2099024517d","observation_id":"d64c4961-67fb-4c63-931b-d362dee8a31a","resolution":{"observed_at":"2026-08-07T05:35:02.193147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-07T05:35:01.461405Z","title":"arXiv preprint arXiv:2402.14289 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.461405Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:f320092344bd6f5238335b93d0399171e23b10dda2df2772c948cab514663e9b","observation_id":"6e5432f4-f86a-401a-aee8-0a3b2816e9df","resolution":{"observed_at":"2026-08-07T05:35:01.461405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2506.07627."}