{"as_of":"2026-08-05T21:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:462279331626332217e19504539bbbacc9d97bb1afc0e9cd591053680f21f9d7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:53:10.352603Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:37.114920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-07-06T20:17:47.599899Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:c346fade407fbfdc8d37c631579cbc8bff7760b518906c1370971e8e42bd2ccb","observation_id":"32dfa201-5a44-4629-935a-341775b2f928","resolution":{"observed_at":"2026-05-16T11:39:22.527639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2505.16416","last_updated":"2026-05-21T10:32:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T09:05:01Z","title":"Circle-RoPE: Cone-like Decoupled Rotary Positional Embedding for Large Vision-Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T14:19:34.622854Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2505.16416"},"observation_digest":"sha256:58734e431b5f110ba9645a1c47cba0c12dd9ad01c75eee03e31c67bf6091f4e6","observation_id":"4a5a7488-3a23-49d7-8382-328a111d4aa5","resolution":{"observed_at":"2026-05-22T14:21:39.710173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6e6f492a37457beb5f12ea272ece86a6fa85fcf24dbb43c41d8c8c7bdd405605","observation_id":"37685f8e-c4ee-4ad8-a34f-d2baf8251d9c","resolution":{"observed_at":"2026-05-11T08:30:57.166141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts","version":2},"cited_work":{"arxiv_id":"2501.04322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04322","snapshot_observed_at":"2026-07-03T04:27:37.114920Z","title":"Eve: Efficient multimodal vision language models with elastic visual experts","venue":null,"work_id":"bbf51eba-716b-46c9-97d7-15e5938366c6","year":2025},"citing_paper":{"arxiv_id":"2606.10651","last_updated":"2026-06-09T09:58:08Z","snapshot_observed_at":"2026-07-06T23:49:51.672382Z","submitted_at":"2026-06-09T09:58:08Z","title":"Kwai Keye-VL-2.0 Technical Report","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-27T13:53:10.352603Z"},"links":{"cited_paper":"/paper/2501.04322","citing_paper":"/paper/2606.10651"},"observation_digest":"sha256:33db6ecb4ce65ad455b1e7c9c8ccfe0f9889327fdb12b97434424174b83f76ec","observation_id":"dc1f5f79-6025-4147-93c1-4f3c8fc73760","resolution":{"observed_at":"2026-07-03T04:27:37.116550Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.04322/citation-record","integrity":"/paper/2501.04322/integrity","json":"/paper/2501.04322/citation-record.json","paper":"/paper/2501.04322"},"outbound":[],"paper":{"arxiv_id":"2501.04322","last_updated":"2025-01-23T08:24:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T16:12:52.104741Z","submitted_at":"2025-01-08T07:42:54Z","title":"Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2501.04322."}