{"as_of":"2026-08-11T17:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3c49bce6585a3da858a32abca8b717c10192cda0dc8fb05698acadd86cd1af4a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:36:34.710222Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:30.418964Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-11T16:36:34.710222Z","title":"Gary Chan, and Hongyang Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09936","last_updated":"2024-12-13T07:51:32Z","snapshot_observed_at":"2026-08-11T16:30:42.673074Z","submitted_at":"2024-12-13T07:51:32Z","title":"CaLoRAify: Calorie Estimation with Visual-Text Pairing and LoRA-Driven Visual Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:36:34.710222Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2412.09936"},"observation_digest":"sha256:46fb4e6f6ee6f2d1daca31e24d73a6008f1be969c46bf4f404adfc5ec87d5e21","observation_id":"8847315a-6971-4b00-a272-49be1b9d1b92","resolution":{"observed_at":"2026-08-11T16:36:34.710222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-11T12:46:59.433530Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:46:59.433530Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2412.13871"},"observation_digest":"sha256:ff269e170eada7cab556f62e2a16200cb78abe96b87c2933ead8ac0918f2ad9e","observation_id":"0b2efd09-6a65-4065-bb2f-bb74d5075251","resolution":{"observed_at":"2026-08-11T12:46:59.433530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T11:39:22.340737Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2501.04001"},"observation_digest":"sha256:d3ecd6111e049f10c398da93e38bfe51774d1c75c35ad9acaafe1638fb1966c5","observation_id":"05ff9b75-378d-4771-9df1-bd40edd1ee85","resolution":{"observed_at":"2026-05-16T11:39:22.476383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:1d09c223902d6d2740ae6ad2b8c3cf7938ad7482b0906a3f5ab7d142b90cf410","observation_id":"b62095e3-85b8-401e-96ee-90db625f3260","resolution":{"observed_at":"2026-05-12T10:53:26.615927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-08-04T09:45:01.649392Z","title":"Revisiting referring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.13796","last_updated":"2026-06-03T15:56:23Z","snapshot_observed_at":"2026-08-10T17:19:58.119505Z","submitted_at":"2025-10-15T17:56:15Z","title":"The Mechanistic Emergence of Symbol Grounding in Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T09:45:01.649392Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2510.13796"},"observation_digest":"sha256:05ee1a8ef0f1d0b1880a4e4c792926d614787a954c51eaf8ae2f963c7551d9eb","observation_id":"0d56b3be-ae1c-4d34-9335-5e815e5e7573","resolution":{"observed_at":"2026-08-04T09:45:01.649392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":"2406.16866","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-02T03:06:30.418964Z","title":"Revisiting refer- ring expression comprehension evaluation in the era of large multimodal models","venue":null,"work_id":"fb0b98eb-d70a-448f-8931-92dcb59d161d","year":2024},"citing_paper":{"arxiv_id":"2606.04282","last_updated":"2026-06-02T23:14:46Z","snapshot_observed_at":"2026-07-06T23:44:23.633099Z","submitted_at":"2026-06-02T23:14:46Z","title":"FindIt: A Format-Informed Visual Detection Benchmark for Generalist Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:16:53.915716Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2606.04282"},"observation_digest":"sha256:5f866e6e180ddafd8a84ec2c771b3787cc49c30e2691bbb3b10e670dcd37007b","observation_id":"7f446895-3ac8-403a-9351-5e3c71dd2064","resolution":{"observed_at":"2026-07-02T03:06:30.421473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16866","snapshot_observed_at":"2026-07-12T11:14:52.015620Z","title":"Cheng, T.; Song, L.; Ge, Y.; Liu, W.; Wang, X.; and Shan, Y.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.28862","last_updated":"2026-07-05T22:18:45Z","snapshot_observed_at":"2026-08-04T19:17:44.996159Z","submitted_at":"2026-06-27T11:10:33Z","title":"HKVLM: Faithful Query--Region Binding for Frozen-Detector Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T11:14:52.015620Z"},"links":{"cited_paper":"/paper/2406.16866","citing_paper":"/paper/2606.28862"},"observation_digest":"sha256:c0506aa714538dd96d093f4fcd247426146c3ad0d8e377277a5482754eea8042","observation_id":"a2cf8f59-6714-45bc-8395-4bdbb072b083","resolution":{"observed_at":"2026-07-12T11:14:52.015620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.16866/citation-record","integrity":"/paper/2406.16866/integrity","json":"/paper/2406.16866/citation-record.json","paper":"/paper/2406.16866"},"outbound":[],"paper":{"arxiv_id":"2406.16866","last_updated":"2024-06-24T17:59:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:19:28.068068Z","submitted_at":"2024-06-24T17:59:58Z","title":"Revisiting Referring Expression Comprehension Evaluation in the Era of Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2406.16866."}