{"as_of":"2026-08-13T08:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41eb5e900ed0bc745003cf4c818496d106364e4edc59b00fec136905f63c48a0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:49:43.430211Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T08:45:34.774087Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-08-12T19:49:43.430211Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10332","last_updated":"2025-03-21T12:40:26Z","snapshot_observed_at":"2026-08-12T21:35:41.232161Z","submitted_at":"2024-11-15T16:32:34Z","title":"Number it: Temporal Grounding Videos like Flipping Manga","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:49:43.430211Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2411.10332"},"observation_digest":"sha256:70e7bcc1a602864ecfd1a9d19436dd1820dd69d904005d49772427e362d8aa9d","observation_id":"e4b763a7-98c6-4ce9-939a-2904564c83d9","resolution":{"observed_at":"2026-08-12T19:49:43.430211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-08-11T05:41:33.187905Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17292","last_updated":"2024-12-23T05:24:26Z","snapshot_observed_at":"2026-08-11T18:22:21.476034Z","submitted_at":"2024-12-23T05:24:26Z","title":"AV-EmoDialog: Chat with Audio-Visual Users Leveraging Emotional Cues","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:41:33.187905Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2412.17292"},"observation_digest":"sha256:f17ef611262cce866bedf44e246da1004fa046fea5ee263d6719fefc718145a2","observation_id":"e4b3b818-95d7-4f05-ab8b-ab48d29d055f","resolution":{"observed_at":"2026-08-11T05:41:33.187905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-08-06T23:57:23.706651Z","title":"arXiv preprint arXiv:2402.11248 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15681","last_updated":"2026-06-25T14:33:27Z","snapshot_observed_at":"2026-08-08T08:54:57.204006Z","submitted_at":"2025-06-18T17:59:49Z","title":"GenRecal: Generation after Recalibration from Large to Small Vision-Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:57:23.706651Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2506.15681"},"observation_digest":"sha256:6e98a97995a7f58f73a9c9bd3dc2601a713a38897508a81852eddd60f5f8e791","observation_id":"076c23f6-468b-4432-b13f-18de9de6da0b","resolution":{"observed_at":"2026-08-06T23:57:23.706651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":"2402.11248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-07-01T08:45:34.774087Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":"b0aeb450-d3d8-464b-a89e-e3b97712885b","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T14:10:27.416341Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:895f0f07503c8966f9ba2af91977d4dd3d2421ae14dee8b54d064bbeab6b6d01","observation_id":"295bfdc5-3e06-45f4-98a3-5525802759ec","resolution":{"observed_at":"2026-05-12T00:46:13.707053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel","version":4},"cited_work":{"arxiv_id":"2402.11248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.11248","snapshot_observed_at":"2026-07-01T08:45:34.774087Z","title":"Collavo: Crayon large language and vision model","venue":null,"work_id":"b0aeb450-d3d8-464b-a89e-e3b97712885b","year":2024},"citing_paper":{"arxiv_id":"2604.25886","last_updated":"2026-06-16T05:05:15Z","snapshot_observed_at":"2026-08-08T01:22:27.799880Z","submitted_at":"2026-04-28T17:29:19Z","title":"MarkIt: Training-Free Visual Markers for Precise Video Temporal Grounding","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-01T08:41:31.700367Z"},"links":{"cited_paper":"/paper/2402.11248","citing_paper":"/paper/2604.25886"},"observation_digest":"sha256:deadaf2818de9f89b5c09df82ba139e1a672a5ebe2181e0e525622e4cfdf8e23","observation_id":"575d8c05-c7f7-42c1-a20a-3df06e7a08c6","resolution":{"observed_at":"2026-07-01T08:45:34.776035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11248/citation-record","integrity":"/paper/2402.11248/integrity","json":"/paper/2402.11248/citation-record.json","paper":"/paper/2402.11248"},"outbound":[],"paper":{"arxiv_id":"2402.11248","last_updated":"2024-06-02T17:34:18Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:17:04.863030Z","submitted_at":"2024-02-17T11:03:02Z","title":"CoLLaVO: Crayon Large Language and Vision mOdel"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2402.11248."}