{"as_of":"2026-08-08T16:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:add21e2ad67cc78f5eb1cc3b9f849709bcf72c8a2355a2ca7cfd994703faca27","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:36:15.479733Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-07T05:36:15.479733Z","title":"A review of multi-modal large language and vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07575","last_updated":"2025-06-09T09:20:20Z","snapshot_observed_at":"2026-08-08T12:50:28.189950Z","submitted_at":"2025-06-09T09:20:20Z","title":"Uncertainty-o: One Model-agnostic Framework for Unveiling Uncertainty in Large Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:36:15.479733Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2506.07575"},"observation_digest":"sha256:cdd96ae8ba4447067662d0da19d3383704f41ca48b94627131e8683e87248470","observation_id":"71f318e2-1579-4182-b768-4d14b299a69d","resolution":{"observed_at":"2026-08-07T05:36:15.479733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-07T00:41:41.097111Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13038","last_updated":"2025-06-17T14:31:50Z","snapshot_observed_at":"2026-08-08T04:56:29.372032Z","submitted_at":"2025-06-16T02:03:41Z","title":"HKD4VLM: A Progressive Hybrid Knowledge Distillation Framework for Robust Multimodal Hallucination and Factuality Detection in VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:41.097111Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2506.13038"},"observation_digest":"sha256:eee505166cb69d8a8a4707d0a6a9f4f3672c5364e439b6a35a0239a603eb1fa1","observation_id":"9830cf20-e016-45ed-bdd3-d6c84b3cfadd","resolution":{"observed_at":"2026-08-07T00:41:41.097111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T11:48:43.288927Z","title":"arXiv preprint arXiv:2404.01322 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02241","last_updated":"2025-09-02T12:09:49Z","snapshot_observed_at":"2026-08-07T06:10:37.238530Z","submitted_at":"2025-09-02T12:09:49Z","title":"LLMs for LLMs: A Structured Prompting Methodology for Long Legal Documents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:48:43.288927Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2509.02241"},"observation_digest":"sha256:17a4e199ad655e37c35d998c58061349faa821a2f82141815309d985931a0317","observation_id":"473f1fd4-803c-41fd-8dc1-524eea4a2891","resolution":{"observed_at":"2026-08-05T11:48:43.288927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-04T12:55:35.364167Z","title":"A review of multi-modal large language and vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.01483","last_updated":"2026-07-20T15:53:14Z","snapshot_observed_at":"2026-08-08T04:43:57.079181Z","submitted_at":"2025-10-01T21:53:44Z","title":"Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T12:55:35.364167Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2510.01483"},"observation_digest":"sha256:8f672f78ca57ef1628457972090fe0d50b973f64e803ddfed8cabee9d705d7d2","observation_id":"a4878e1b-08ea-4c31-b93e-a8c591c66d13","resolution":{"observed_at":"2026-08-04T12:55:35.364167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2604.20190","last_updated":"2026-04-22T05:11:02Z","snapshot_observed_at":"2026-07-31T09:36:22.924731Z","submitted_at":"2026-04-22T05:11:02Z","title":"WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T01:08:34.674972Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2604.20190"},"observation_digest":"sha256:edde3172ff6e49cd0ea27d7581e7be4694a8ec1d3673d241d6b6d5d1f1b667b2","observation_id":"bf1612b3-304e-483a-84bf-ea8147f3fb1d","resolution":{"observed_at":"2026-05-10T01:10:09.177122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.01938","last_updated":"2026-05-03T15:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-03T15:36:42Z","title":"Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T15:58:52.425995Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.01938"},"observation_digest":"sha256:f8046bbaf41009544ed636579e01b0d16e9290d709000901d60458802150f706","observation_id":"b10e73ee-6c9e-4744-9d6e-7b6a957cd787","resolution":{"observed_at":"2026-05-11T16:36:08.685148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.01938","last_updated":"2026-05-03T15:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-03T15:36:42Z","title":"Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:58:52.425995Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.01938"},"observation_digest":"sha256:c910ffe6d25e6b1d8e57b0f9bbc1542bb096c2a686f33a7cdcdede44e22fbeab","observation_id":"ef9fd723-9775-4162-b6dd-aa42fe10423c","resolution":{"observed_at":"2026-05-09T21:58:47.248139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models","version":1},"cited_work":{"arxiv_id":"2404.01322","doi":"10.48550/arxiv.2404.01322","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.01322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A review of multi-modal large language and vision models","venue":"arXiv (Cornell University)","work_id":"b28ccf01-f081-4ca3-b558-c74b07773846","year":2024},"citing_paper":{"arxiv_id":"2605.27920","last_updated":"2026-05-27T03:47:05Z","snapshot_observed_at":"2026-07-06T23:37:36.244456Z","submitted_at":"2026-05-27T03:47:05Z","title":"Rethinking Video-Language Model from the Language Input Perspective","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T13:24:46.360149Z"},"links":{"cited_paper":"/paper/2404.01322","citing_paper":"/paper/2605.27920"},"observation_digest":"sha256:0e5bcfffe6a5cfb539d9bf049642c7639c7d96aca1595ed8733ea10621d40456","observation_id":"57d959cc-61c0-4e1c-9a52-f17246a94efe","resolution":{"observed_at":"2026-06-29T13:33:28.475273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.01322/citation-record","integrity":"/paper/2404.01322/integrity","json":"/paper/2404.01322/citation-record.json","paper":"/paper/2404.01322"},"outbound":[],"paper":{"arxiv_id":"2404.01322","last_updated":"2024-03-28T15:53:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:54:07.815827Z","submitted_at":"2024-03-28T15:53:45Z","title":"A Review of Multi-Modal Large Language and Vision Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2404.01322."}