{"as_of":"2026-08-09T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5860f44cc5b272f011e81e8fa9943ed2ef350c235fcf7943d3a21a51ab1e840c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:34:56.481852Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T04:09:36.400489Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2312.02949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2312.02949 (2023)","venue":null,"work_id":"f2fa5ab0-4adb-4374-a8f9-8d891a8b3e09","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:4f290d09f9c43fc2763cae26a3e75d9f52f0a882d443547ab1167b7c2c6d6b9e","observation_id":"dbefebe2-2949-45df-95ac-ab7fa9d7ad88","resolution":{"observed_at":"2026-05-16T04:09:36.403424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-07T05:34:56.481852Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.481852Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:c4a966908eb92fc942fbd46c731a6b74502495b0520de90f2aad9c255216599f","observation_id":"c210b42b-8c9b-405b-81ac-53a1ea037dab","resolution":{"observed_at":"2026-08-07T05:34:56.481852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-05T23:40:01.128100Z","title":"Llava-grounding: Grounded visual chat with large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05021","last_updated":"2025-08-07T04:15:08Z","snapshot_observed_at":"2026-08-08T00:00:17.393969Z","submitted_at":"2025-08-07T04:15:08Z","title":"MAG-Nav: Language-Driven Object Navigation Leveraging Memory-Reserved Active Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:40:01.128100Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2508.05021"},"observation_digest":"sha256:f8b757df25a7653372911a443bba023e11d2b190d669677d1f191af84d610fb9","observation_id":"413fe7a0-0e3f-4a7f-82d2-55860536bbee","resolution":{"observed_at":"2026-08-05T23:40:01.128100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-06T18:44:53.696241Z","title":"arXiv preprint arXiv:2312.02949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04698","last_updated":"2026-08-05T11:07:22Z","snapshot_observed_at":"2026-08-08T23:12:18.742707Z","submitted_at":"2026-08-05T11:07:22Z","title":"Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-08-06T18:44:53.696241Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2608.04698"},"observation_digest":"sha256:5c1b8c1ee3f8ab73c17cdc61ba4515aadd341d24115925000db673b563f147c7","observation_id":"da724d98-fbb8-42cb-8b5e-2db3129e9ad8","resolution":{"observed_at":"2026-08-06T18:44:53.696241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.02949/citation-record","integrity":"/paper/2312.02949/integrity","json":"/paper/2312.02949/citation-record.json","paper":"/paper/2312.02949"},"outbound":[],"paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2312.02949."}