{"as_of":"2026-08-06T03:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0255fe5045497d25d81f6e9ea4e4d5c7953f5f7f5c428a2bada89ca977e4da6","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T06:01:00.775721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T06:02:37.425276Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:05ec8f6081be2d63bfd9b843dcbe0108cd09940551c2636a84c0348994b33684","observation_id":"eca306c0-c0e9-4e29-9fb6-332af2e57044","resolution":{"observed_at":"2026-05-15T20:21:58.009244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T02:44:53.284345Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2406.07476"},"observation_digest":"sha256:9ecfacb95ff79ee3ec28f950a89f0c1ae5423b1650819a23ee73865ce3de4d56","observation_id":"a8563319-ad34-476c-bb1e-81520d738250","resolution":{"observed_at":"2026-05-11T02:44:53.568946Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2501.05067","last_updated":"2026-04-20T07:42:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-09T08:43:57Z","title":"LLaVA-Octopus: Unlocking Instruction-Driven Adaptive Projector Fusion for Video Understanding","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T06:01:00.775721Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2501.05067"},"observation_digest":"sha256:ccfa91e38db2d2069d828e527b5071f6810d8a5ea0122ea372a35fd99dc1b04c","observation_id":"60027b7f-0915-4a79-b308-14f27afd7e3d","resolution":{"observed_at":"2026-05-23T06:02:37.429698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T00:21:51.621582Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2503.09158"},"observation_digest":"sha256:f81bd1db880560f530650602ebc7bfa5ffdaec1772c5a74218b30fa32a70686e","observation_id":"e16ea5c9-ee3c-424d-bcab-23f5c894bfdb","resolution":{"observed_at":"2026-05-23T00:22:18.717816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens","version":2},"cited_work":{"arxiv_id":"2312.08870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08870","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vista-llama: Reliable video narrator via equal distance to visual tokens","venue":null,"work_id":"59ce56c3-c7fe-4097-8dfb-d4149f0c7603","year":2023},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2312.08870","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:6c4c6bd4df99db0f7556cdbed6d5e4968a3c8eedf9c9b003b0a4f7d8358dd68c","observation_id":"b63e8b36-84b4-41f8-8858-b028fb630932","resolution":{"observed_at":"2026-05-11T08:30:56.944339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2312.08870/citation-record","integrity":"/paper/2312.08870/integrity","json":"/paper/2312.08870/citation-record.json","paper":"/paper/2312.08870"},"outbound":[],"paper":{"arxiv_id":"2312.08870","last_updated":"2025-03-03T17:58:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-12T09:47:59Z","title":"Vista-LLaMA: Reducing Hallucination in Video Language Models via Equal Distance to Visual Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2312.08870."}