{"as_of":"2026-08-19T12:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46d3928f9cfacd8459d51475c7150d03a5420712c4690eb79d2adc6d2c1d9cd6","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:12:46.203510Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:39:46.817981Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:33:33.048939Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":"2501.02699","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5503a6b3-66c9-40d8-81a2-100f16fefc8d","year":2025},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:0ec1de5720177b03c01390e6cb6eb440367d8c2044bdd60b059c4dd8c653ee99","observation_id":"3f6fa8ed-8e71-4294-bb90-12668f424ada","resolution":{"observed_at":"2026-05-11T12:33:33.052044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-08-07T11:39:46.817981Z","title":"Eagle: Enhanced visual grounding minimizes hallucinations in instructional multi- modal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01850","last_updated":"2026-06-05T03:03:30Z","snapshot_observed_at":"2026-08-16T05:40:16.288402Z","submitted_at":"2025-06-02T16:38:50Z","title":"MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:46.817981Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2506.01850"},"observation_digest":"sha256:543905daed4c95d71ce954eaf52b953da518621298cbe652c05826cb49ea53b3","observation_id":"83d1695a-9fc1-4e70-86bc-45c46c44e8d2","resolution":{"observed_at":"2026-08-07T11:39:46.817981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-08-05T20:29:03.976981Z","title":"Villa et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-13T23:10:52.614750Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":209,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:03.976981Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:5f9db73f4c9975ebed9c8b11056818d2bba06a534cb89e09efc53b60258e38de","observation_id":"9e0cb9c0-6a7d-45ad-bf9a-db4528cb194b","resolution":{"observed_at":"2026-08-05T20:29:03.976981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-08-03T23:35:18.923981Z","title":"Eagle: Enhanced visual grounding minimizes hallucinations in instructional multimodal models.arXiv preprint arXiv:2501.02699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.923981Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:ceb4294c49164bfe7e5dfac62aba31d3fc13fa1ad709c6760ffa5cf458470360","observation_id":"e52a1569-1195-4c37-a629-46c10e323306","resolution":{"observed_at":"2026-08-03T23:35:18.923981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-08-03T08:57:18.134481Z","title":"Eagle: En- hanced visual grounding minimizes hallucinations in instruc- tional multimodal models.arXiv preprint arXiv:2501.02699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.15408","last_updated":"2026-06-06T22:36:23Z","snapshot_observed_at":"2026-08-15T00:38:31.768974Z","submitted_at":"2026-01-21T19:19:41Z","title":"CURE: Curriculum-guided Multi-task Training for Reliable Anatomy Grounded Report Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T08:57:18.134481Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2601.15408"},"observation_digest":"sha256:40a0e7109b7d9702ec82c3158abc84f39922b3c3932adac26c89813bff917508","observation_id":"65cc5cbc-6c77-4dca-8e7e-da991fdcbdbd","resolution":{"observed_at":"2026-08-03T08:57:18.134481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02699","snapshot_observed_at":"2026-07-31T23:32:06.683252Z","title":"arXiv preprint arXiv:2501.02699 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23944","last_updated":"2026-07-27T02:40:49Z","snapshot_observed_at":"2026-08-13T00:45:18.135377Z","submitted_at":"2026-07-27T02:40:49Z","title":"DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T23:32:06.683252Z"},"links":{"cited_paper":"/paper/2501.02699","citing_paper":"/paper/2607.23944"},"observation_digest":"sha256:36332e6954c733f731bbe49934c704cc98b7c0eafa1a2dd3e2b65895a087ddf8","observation_id":"7e809645-c5ef-4a63-bc2b-21e91d2d3166","resolution":{"observed_at":"2026-07-31T23:32:06.683252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02699/citation-record","integrity":"/paper/2501.02699/integrity","json":"/paper/2501.02699/citation-record.json","paper":"/paper/2501.02699"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T22:12:44.251736Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.251736Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:bdc76255ecc4c1c4b1faf55d3771773945b1951d97cbe01c9c5486df9ef0cdd4","observation_id":"c7b9e58d-426c-4226-af10-28feab2a975b","resolution":{"observed_at":"2026-08-10T22:12:44.251736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.894835Z","title":"From colouring-in to pointillism: revisiting semantic segmentation supervision,","venue":null,"work_id":"544ce375-72d7-4e2d-b622-4424430e874c","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.296963Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:995d270eea851f570d4d06e49a6092fafeb4deef011e4f133500ed566d324c97","observation_id":"0a343b1a-2c71-4d75-9b27-31a539697c31","resolution":{"observed_at":"2026-08-10T22:12:52.954875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.714837Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"7d53f864-f1d3-4572-beca-7ac8b7a8c372","year":1901},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.364762Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:cad3fe702f87c44928af8c9929fdf938c476400a1bcb624a62b46bd1c61ec93d","observation_id":"a7042ddb-c0cd-432d-84ac-f696ee083c86","resolution":{"observed_at":"2026-08-10T22:12:52.765074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.534756Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"4df52e26-acb2-4c24-8ae4-866c0d9c1af0","year":2020},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.424825Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:a69fa7d6848c10a717caa907f474e6751958baa17d8547e4c23adb48d47a87d9","observation_id":"d3008bc1-1a52-4ac6-bb86-461bc590c0b5","resolution":{"observed_at":"2026-08-10T22:12:52.584897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.348188Z","title":"Pali: Scaling language-image learning in 100+ languages","venue":null,"work_id":"c7606586-c213-4d61-b598-dcb89e3c02e0","year":2022},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.453927Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:33909543c1826c826f73697538bec092dd4f6051c59d3b066b6c2e99113ea48a","observation_id":"05bad6a0-b0f8-44e1-92d0-4b8b5337f409","resolution":{"observed_at":"2026-08-10T22:12:52.392965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.194828Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"06f49308-2727-4ac3-af7f-db45d79e741a","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.463204Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:c3c7fac967fcb6e85a63251a9dea97755a4a5f6d20aea176c767ef7d750ddf28","observation_id":"295dfee2-7742-4d67-bf2c-1a7c9b24c125","resolution":{"observed_at":"2026-08-10T22:12:52.254841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:52.054836Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"ab3e785f-3619-4176-9714-7c8ae99ff91d","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.484447Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:501f4f75e8428a19ff5229a01a0595c86dc60ddb948bbd38f56abb02905f8af6","observation_id":"bd63c6de-4d5c-4948-b8bd-8fc567f0c520","resolution":{"observed_at":"2026-08-10T22:12:52.083232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.896243Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":"8a3e2174-b94c-4652-8338-d1608fd4eb34","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.544990Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:a73bcc822141d2deace8a51ddce0d9ceab94abe4c33c0db91f8e20e96750a82c","observation_id":"1b7ca14f-55bc-4981-9cdc-d76196d4bf43","resolution":{"observed_at":"2026-08-10T22:12:51.920778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.791935Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"7a00b589-a830-4f1f-9d99-c6c0c2a8b67f","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.584748Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:db34602a1a35d8b1dd798f58db132f0998c0b90d598157017e24b740f08d02f6","observation_id":"3ea23f45-5b55-4806-a84b-674e585aac84","resolution":{"observed_at":"2026-08-10T22:12:51.833134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T22:12:44.634750Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.634750Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:597025188887a7544a71c35f4af798e61974db516eccf854f4a1ae62d6a41ffb","observation_id":"0b528abc-5b6d-470e-bfd7-fdf62a34c9b4","resolution":{"observed_at":"2026-08-10T22:12:44.634750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-10T22:12:44.674747Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.674747Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:54911e1a7541edac20570a05e0616c3678dbbb1d2e1dcd474a63d637299a4b23","observation_id":"e3a372a6-26b2-42c9-be24-1ffdb16a0a21","resolution":{"observed_at":"2026-08-10T22:12:44.674747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-10T22:12:44.724730Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.724730Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:9266c9c1997af9be5ebd424e574639f9f06833881178688e4b6339c59437fca1","observation_id":"42ec67c8-c742-411e-9e4b-e5bce5ad1869","resolution":{"observed_at":"2026-08-10T22:12:44.724730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.620575Z","title":"A unified continual learn- ing framework with general parameter-efficient tuning","venue":null,"work_id":"65b15d2a-e3d0-4d2a-b3b5-c98cb3cbadae","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.775478Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:52bee9ce0f5504ae682d1fb8e56dd230e3aaf4e376307e67c6b81b2200e5364e","observation_id":"480426e8-a53b-436f-8222-3f5ac6131c2e","resolution":{"observed_at":"2026-08-10T22:12:51.685406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.501108Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":"66f07b76-7c95-4709-bd28-9c5dd2b6f990","year":2020},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.824750Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:25d01fd0f2cde1cee1562589a9fa1b4fc9134347ab43844bca6d17c0c114e496","observation_id":"17fd81d1-ee78-43f7-a47d-00aef5545268","resolution":{"observed_at":"2026-08-10T22:12:51.544757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.343476Z","title":"Hal- lusionbench: An advanced diagnostic suite for entangled language hallucination and visual illusion in large vision- language models","venue":null,"work_id":"4245e87d-64f8-4042-b6ac-db5d1051b1e5","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.864868Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:08930c73fde35af055b14e307ffb091c8faff6233373c5b51fa1c54b4da7d1c9","observation_id":"6fe60b39-e4c5-445c-9b7d-12051a3fbf12","resolution":{"observed_at":"2026-08-10T22:12:51.382895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.225090Z","title":"Dimension- ality reduction by learning an invariant mapping","venue":null,"work_id":"0f770351-bdcd-4fc7-898e-03bd02be531c","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.920819Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:d9346174de446a0c1a5b2c2009643b1cfe3b04c8224d8113071aa7c54084a21f","observation_id":"bb3d1da8-92c7-442b-aa18-140b45367798","resolution":{"observed_at":"2026-08-10T22:12:51.255103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.115744Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"3307ba06-cfc8-4381-8d6d-8a8e62849458","year":2020},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:44.974859Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:c41aa6d68acaad86b6993cf054e412c5991bc62efb5e1665ce073bb68f28296b","observation_id":"300379b3-abc7-4e0a-bc4e-018c85f0604a","resolution":{"observed_at":"2026-08-10T22:12:51.148550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:51.021454Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"a86e6df1-1533-496e-9f77-48afdd5cbb8a","year":2022},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.035048Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:b1b6499082749de231ed16ff99c0b645f30891aa72cfe86501bfb09792bae5db","observation_id":"fe3f92e1-3b6e-4386-b31a-43b7c5d11564","resolution":{"observed_at":"2026-08-10T22:12:51.051988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:50.947386Z","title":"BRA VE: Broadening the visual encoding of vision-language models","venue":null,"work_id":"b3b336fc-3f31-4553-ba14-031546d4bd3d","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.086231Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:d2efb4b0008cbb58f115a1e8639aaecf9025dfd76266724ca95fa9e2e6dd9d42","observation_id":"06141fea-6bb7-4ecc-a2b3-a91be3ae543f","resolution":{"observed_at":"2026-08-10T22:12:50.986785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:50.790364Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"f19480d8-ec8b-4b88-845c-4c7e9ca45d4c","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.134839Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:bbd7f5782f47843345b1eb18b304598758f60a3327d0a8553ca233d85e72179a","observation_id":"5a82ff62-5666-49b7-a6b4-b69f49c4fde7","resolution":{"observed_at":"2026-08-10T22:12:50.828960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:50.615993Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"a1fd35a2-d1e9-44bf-a54d-5d9cab2029d6","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.162801Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:5905e7918d09b2e0ce58ea8842e648e7d3750bf249939230d93d8fd6fc2afc69","observation_id":"5475cd02-fe9e-41d1-a807-c216b85c3f2d","resolution":{"observed_at":"2026-08-10T22:12:50.684823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:45.205998Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.205998Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:96e69f5ef590efe3952bb22f47e896dcb7120d8f85be396c0869a9dd738f7efb","observation_id":"9242b92d-a487-4efe-9c13-01176c3c2c61","resolution":{"observed_at":"2026-08-10T22:12:45.205998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:50.144940Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"89ff3ad9-cf3b-4788-bd84-c155c4a1066c","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.236334Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:b98fa1f9570f78fbec30de9a86d19849e1bbf7a7cc589eb22dcacc9abcbd2932","observation_id":"0ecc45de-0f82-4f83-b926-50dd3a274eae","resolution":{"observed_at":"2026-08-10T22:12:50.184915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.984616Z","title":"Visual instruction tuning","venue":null,"work_id":"acd23389-e3c5-47fa-92c7-17c113d30db7","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.247018Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:ebbd47ba5497e6ce32a0d57e50f92f2efc5146577dee4c39a2a8e447c4ed7d5f","observation_id":"fdfe1b4f-0fff-4b23-93c4-10d09b7fdad3","resolution":{"observed_at":"2026-08-10T22:12:50.013967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T22:12:45.264752Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.264752Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:60d1a70c3752ddafd8f1ac4045d2184c8d8c074e7db6085e5edddca77415ea83","observation_id":"2df76d0f-031b-485e-93e0-ae15b865f0ee","resolution":{"observed_at":"2026-08-10T22:12:45.264752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.904757Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"b598b07f-8339-4c66-b670-e528c46fe2fd","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.304752Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:478eedc564219703140f6c7da3199cd46813d5b1664d787a185504b170bdfbba","observation_id":"63674953-6d78-4576-887f-d3fe1d4463bf","resolution":{"observed_at":"2026-08-10T22:12:49.938858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-10T22:12:45.347445Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.347445Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:eb058ef2326def5ed28c4714ac68f1ced46cd1dae62f9bde957522a14043cdef","observation_id":"a788af3f-93ba-4716-844f-0c764e310eea","resolution":{"observed_at":"2026-08-10T22:12:45.347445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.745088Z","title":"Grounding multimodal large language models to the world","venue":null,"work_id":"afb9ec56-90b1-4f4d-ae33-8a5c43599802","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.382543Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:d85574501dacfeb51cbc774decda6a2a06c9f1448dd71f74f680c16df3ead185","observation_id":"09d6a444-330f-4814-a7b1-7066a29cd35c","resolution":{"observed_at":"2026-08-10T22:12:49.784833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.574753Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"afed3c4a-3eb5-440d-a663-18592f48b94a","year":2021},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.444757Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:fa9f61b120e267df0c493c6d79742260ad054ec310bceb8e826c1b9cb968974a","observation_id":"32d80f44-e30b-4224-9dce-ec26c648ec6e","resolution":{"observed_at":"2026-08-10T22:12:49.624754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.421509Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"b2f5d503-781e-4abd-a455-b52e54d5fc72","year":2020},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.494753Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:833df032431cca35844f0a21ca8a9ad3f539b005c26c0ea67c972abe0c2801cd","observation_id":"84eeb2b9-2e1b-4566-a8b2-b566d629f2c2","resolution":{"observed_at":"2026-08-10T22:12:49.464845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:49.264911Z","title":"xgen-mm-phi3-mini-instruct model card, 2024","venue":null,"work_id":"07c445cb-57fd-4fd0-b19d-aacea9b7e857","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.546305Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:d58846de4a45206de1a1b951632d7b7632646bd3e1a602343eefc3a744a1842f","observation_id":"f04221c6-25e9-404c-a1fa-84982be34d33","resolution":{"observed_at":"2026-08-10T22:12:49.311266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:45.588051Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.588051Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:30d3dc52fddbaefd7127dd6536420c794296b1dbfbbb4a294597196e4bf2dcf2","observation_id":"5af1e5ca-f966-4c73-a321-995674b0c369","resolution":{"observed_at":"2026-08-10T22:12:45.588051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:45.634749Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.634749Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:d9aa9546a48f6c5c707b4c7cac8f0f57873909f8802d5cfadb2c8816fba48e42","observation_id":"635290f4-9207-4838-9dbf-00fc11950316","resolution":{"observed_at":"2026-08-10T22:12:45.634749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.854758Z","title":"Eyes wide shut? exploring the vi- sual shortcomings of multimodal llms","venue":null,"work_id":"c921b448-af05-4972-b327-ac3a492da229","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.677014Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:a450ab515816715ea789f653eeec9cc470ebbad4c258a93e1babacb93ba8f3e2","observation_id":"5ef7d0e3-9af0-47fa-aeee-ede1cf3e9863","resolution":{"observed_at":"2026-08-10T22:12:48.905413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:12:45.716145Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.716145Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:72fa4eecf0390e95371f92f5f4a32effef60db96a13b995bba76e31b5b82b582","observation_id":"b95bbb3a-0605-47f3-9421-11dd07e27506","resolution":{"observed_at":"2026-08-10T22:12:45.716145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.704890Z","title":"Pivot: Prompting for video con- tinual learning","venue":null,"work_id":"259d7e10-34a3-4139-8c18-423403aa09b0","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.764756Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:2b10d9aa66d2c137417258f50960d3a7ffffc25795180812677eff02e406b267","observation_id":"96c09293-1ff0-4048-9783-5fa2c93009f0","resolution":{"observed_at":"2026-08-10T22:12:48.744839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.514927Z","title":"Behind the magic, merlim: Multi- modal evaluation benchmark for large image-language mod- els, 2024","venue":null,"work_id":"c640f8e7-82c5-47be-b890-a79cebe154ac","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.815414Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:93f015278e4badaf1b5e734b09321e536f7bf311c6fc638baa118f9d0c93a041","observation_id":"b1828c33-1c9c-4cc2-b7f8-29247a18e67e","resolution":{"observed_at":"2026-08-10T22:12:48.564753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05223","last_updated":"2025-03-07T21:18:41Z","snapshot_observed_at":"2026-08-16T13:45:02.141147Z","submitted_at":"2024-06-07T19:10:35Z","title":"CorDA: Context-Oriented Decomposition Adaptation of Large Language Models for Task-Aware Parameter-Efficient Fine-tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05223","snapshot_observed_at":"2026-08-10T22:12:45.874755Z","title":"Corda: Context-oriented decomposition adaptation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.874755Z"},"links":{"cited_paper":"/paper/2406.05223","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:9474a98d3f26272bd9cfc65564dbfc965d71abbde03eed94246406bf13eb1984","observation_id":"b63a8b17-9a5d-4957-b9e6-21f37885b11d","resolution":{"observed_at":"2026-08-10T22:12:45.874755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.354975Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"9c36fa9a-23a5-4c8a-868d-9e7fbed91a50","year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.944753Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:1c9496849e9f2c4324951e8a85320454ee9cb5208b9c707c0908c55b7e16e9b6","observation_id":"701f9a50-6733-426d-8c1a-a1422a1dcc10","resolution":{"observed_at":"2026-08-10T22:12:48.405323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.193706Z","title":"Galore: Memory- efficient llm training by gradient low-rank projection, 2024","venue":null,"work_id":"9dce5c14-bdb7-475e-b281-e2ca766b7276","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.994195Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:1b8e4714e9fb96c7ecc915c91247fcc1b310a5defea95745d6a29e59797c036a","observation_id":"f5d1b0f0-9725-4153-b827-08613a188c29","resolution":{"observed_at":"2026-08-10T22:12:48.238813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:48.019206Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":"d8d51c89-9688-4e64-bce6-64e7cff1b20d","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.042073Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:4df01c3703658defe53970487baad1ba33be8e7e708afb2647233d49fd580fc6","observation_id":"8a0cf7ee-cb42-4269-8d08-5d482c3ed60e","resolution":{"observed_at":"2026-08-10T22:12:48.065807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T22:12:46.074760Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.074760Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:7633bdf0413a6c150552445f15d2a6afb90977978a65360434a4675fcecf71d8","observation_id":"f597d41b-bfd7-46b8-a88d-c284693e4134","resolution":{"observed_at":"2026-08-10T22:12:46.074760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:47.835127Z","title":"LLA” (LLaV A-1.5), “LLA*","venue":null,"work_id":"47fcbc3a-d303-442b-81aa-a424ba8eee9a","year":2024},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.104763Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:c35606720472b9c86cd5f40bda77c69a22d1ffaa1e16c2184720552543961351","observation_id":"ad788c7b-c3b7-46c7-9ac5-2784493283e4","resolution":{"observed_at":"2026-08-10T22:12:47.914917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:47.675967Z","title":"We compare the zero-shot and linear probing performance of EAGLE-tuned VLMs against the original models","venue":null,"work_id":"4d1be9aa-2622-4e22-9d34-c24303cb0178","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.140752Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:58e9dba508ddfe811b63e20701a30fb86c8620796fa3e9ad9d8b39cfc785ee8c","observation_id":"9afe98ca-a354-49c4-a965-ac45f47ab924","resolution":{"observed_at":"2026-08-10T22:12:47.714755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:47.505778Z","title":"Figure 3 presents 3 additional scenarios when EAGLE effectively reduces the hallucinations of the IT-VLMs","venue":null,"work_id":"88b59ad7-171e-4743-9914-e3a8730ca611","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.185025Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:5c7ecf6c70c93345c73ebdc40678a1e608642530692df0164b5ad2d54c74231e","observation_id":"d41bdf56-ba47-46dc-9a91-7014699d54b2","resolution":{"observed_at":"2026-08-10T22:12:47.555717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:47.345177Z","title":"The same hyperparameters are applied to both VLMs, EV A01-CLIP- g-14 and OpenAI CLIP-L-14-336","venue":null,"work_id":"c8701495-3867-4fad-8f15-9fd1beab1a5f","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:46.203510Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:7ffa4b6393fdb65c13c4d0155bf4d3a197c2b19f437ba10e01a1ff0f62e2a998","observation_id":"2d98a4e1-12c9-4405-a4ea-9d474b4d1b83","resolution":{"observed_at":"2026-08-10T22:12:47.404903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:12:50.417558Z","title":null,"venue":null,"work_id":"86dc8fcd-f639-4649-a43d-c5da8b523517","year":null},"citing_paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:12:45.183653Z"},"links":{"citing_paper":"/paper/2501.02699"},"observation_digest":"sha256:33245fa6be6601270e42285a3da99a7722ed78d1af413eabbaf88f55f2f9857e","observation_id":"b7eceb0f-73eb-4269-b15b-d19ff7b11c95","resolution":{"observed_at":"2026-08-10T22:12:50.460160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.02699","last_updated":"2025-01-06T00:39:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T09:16:42.827399Z","submitted_at":"2025-01-06T00:39:31Z","title":"EAGLE: Enhanced Visual Grounding Minimizes Hallucinations in Instructional Multimodal Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 6 inbound Pith citation observations for arXiv:2501.02699."}