{"as_of":"2026-08-11T11:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67023d667f176efd7191f4c644581916225607f5b2e799768354cd14610ee352","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T21:39:21.630533Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T06:20:36.339231Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":"2407.14177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":"b6217f7f-32fb-451b-96de-f81d0a3eb00c","year":2024},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:f3ceb7dbb58d8e0b74d7c286959d77274c64c8cf8938ccb5116cfcd01a6076f6","observation_id":"95ac0b8e-6af4-4f6c-862b-3910245f4064","resolution":{"observed_at":"2026-05-20T06:20:36.342787Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":"2407.14177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":"b6217f7f-32fb-451b-96de-f81d0a3eb00c","year":2024},"citing_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T01:55:12.501409Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2409.17146"},"observation_digest":"sha256:240709a35ca1f7b6287f05356dcfd58a6b76f9b9442c9394518203abc6fb70c1","observation_id":"0c4271e4-c97b-4810-9b10-48639d805bf4","resolution":{"observed_at":"2026-05-15T01:55:12.572829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-09T21:39:21.630533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19036","last_updated":"2025-05-30T12:26:44Z","snapshot_observed_at":"2026-08-10T12:01:17.734125Z","submitted_at":"2025-01-31T11:09:16Z","title":"RedundancyLens: Revealing and Exploiting Visual Token Processing Redundancy for Efficient Decoder-Only MLLMs","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T21:39:21.630533Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2501.19036"},"observation_digest":"sha256:ac3f40bae85d6a608f2659f949fc05fc9b96e632e90216e673276fbe91e1c981","observation_id":"bd44a04c-86c7-44f6-a822-f14fb55347d5","resolution":{"observed_at":"2026-08-09T21:39:21.630533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-07T06:02:30.175851Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06279","last_updated":"2025-06-06T17:59:06Z","snapshot_observed_at":"2026-08-09T01:20:21.315494Z","submitted_at":"2025-06-06T17:59:06Z","title":"CoMemo: LVLMs Need Image Context with Image Memory","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:02:30.175851Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2506.06279"},"observation_digest":"sha256:21fd82b769896b8e6493056d7126c8d84b93549147d4b97e357eaa54f4f91f03","observation_id":"aa14a1d1-29be-4aeb-89cf-76468b19416b","resolution":{"observed_at":"2026-08-07T06:02:30.175851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-06T21:22:27.089083Z","title":"Evlm: An efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02978","last_updated":"2025-07-01T03:05:56Z","snapshot_observed_at":"2026-08-08T00:06:19.287707Z","submitted_at":"2025-07-01T03:05:56Z","title":"Ascending the Infinite Ladder: Benchmarking Spatial Deformation Reasoning in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:22:27.089083Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2507.02978"},"observation_digest":"sha256:acc7fd100397e61cc3caaa53f04028022827c2e06a8873f73af40a4680d8f8cb","observation_id":"ff8c83f7-2708-46ab-b3b5-8589b3cf3601","resolution":{"observed_at":"2026-08-06T21:22:27.089083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-05T23:32:17.808793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.808793Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:9cde5dbe19caac17b6623b8293a81923a3d1a89f5ef0a3d95ba845f3b9a7c4c7","observation_id":"865f3073-7922-4280-8fb8-51adb5bb41d0","resolution":{"observed_at":"2026-08-05T23:32:17.808793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14177","snapshot_observed_at":"2026-08-03T10:18:31.583291Z","title":"EVLM: an efficient vision-language model for visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.10710","last_updated":"2026-07-02T13:06:44Z","snapshot_observed_at":"2026-08-03T10:18:29.238799Z","submitted_at":"2026-01-15T18:59:10Z","title":"From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:18:31.583291Z"},"links":{"cited_paper":"/paper/2407.14177","citing_paper":"/paper/2601.10710"},"observation_digest":"sha256:62c1093b0c5db0d7c043007fcf608e6da3e840edca0d3c317c57ed773371f74e","observation_id":"56b4e346-6a64-4462-8f01-3ed46df19c48","resolution":{"observed_at":"2026-08-03T10:18:31.583291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.14177/citation-record","integrity":"/paper/2407.14177/integrity","json":"/paper/2407.14177/citation-record.json","paper":"/paper/2407.14177"},"outbound":[],"paper":{"arxiv_id":"2407.14177","last_updated":"2024-07-19T10:09:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T15:46:51.929644Z","submitted_at":"2024-07-19T10:09:51Z","title":"EVLM: An Efficient Vision-Language Model for Visual Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2407.14177."}