{"as_of":"2026-08-23T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7531811177bd878ef5b33eac47c2255a11e77d079cc360a41de68f54ae873eea","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T19:49:20.020874Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05978/citation-record","integrity":"/paper/2607.05978/integrity","json":"/paper/2607.05978/citation-record.json","paper":"/paper/2607.05978"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:35dc3cb9cc7f5ad433ccf5392e016a1fa70766c5eed6d04c642fff3df7169dc3","observation_id":"49ca3f7d-9d52-4e68-9e85-9533f3f7ada9","resolution":{"observed_at":"2026-07-08T19:55:33.910545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.263795Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"66ee8476-38ee-4d4c-b1a4-47df331883ec","year":2020},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:96148af88a415091ac46f94d4a2d26c7ec335e6f8cd135da4ed5ba0d8919e284","observation_id":"65a341be-a14d-4d58-a01b-06044049e8f1","resolution":{"observed_at":"2026-07-08T20:45:37.264918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:0ccf0764539583c48646845ac7be713a3f982f50fbe8bf7ff6f96d441a6047ed","observation_id":"3768151d-15c9-49b2-a0f1-695000a92cfe","resolution":{"observed_at":"2026-07-08T19:55:33.905378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.269187Z","title":"BEATs: Audio pre-training with acoustic tok- enizers","venue":null,"work_id":"bf6dfd3e-0797-4dcc-b9d4-6a806767b18c","year":2023},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:9d64f0bdf0bca1014f05d03caf9d7b2fc3b9716cb9f01bd25efa56b502a3a930","observation_id":"aefe5c54-efa5-487d-b89a-7d89ae8a04d2","resolution":{"observed_at":"2026-07-08T20:45:37.273355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:1c3f692dc2f08073a3d51202cfc773697bceceff82fcfd4d1af0b897336bd417","observation_id":"8223a1a4-b59f-46e4-b110-a41da26b81d0","resolution":{"observed_at":"2026-07-08T19:55:33.907904Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.265481Z","title":"Lookback lens: De- tecting and mitigating contextual hallucinations in large lan- guage models using only attention maps","venue":null,"work_id":"91ddabb0-488a-46c7-9d5b-65c065e92719","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:b7c23f1f3fbd6782252e58571a49203b6c017689b824137b1e2028767efbe0ab","observation_id":"ef046333-4b51-45c5-a0d8-e50586390d8a","resolution":{"observed_at":"2026-07-08T20:45:37.266727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.291016Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"0cb3b41c-31f9-43b3-8cb8-4033fdd05c60","year":2022},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:a30e2d9a6de4d91f62de689dcdee9fa3ea4a3dc9c2bfe3415d2791c8155cd154","observation_id":"e3d90b48-35f9-4d10-9cd0-de7588d00934","resolution":{"observed_at":"2026-07-08T20:45:37.292144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.275488Z","title":"coco-gemini: Zero-shot COCO detec- tion with Gemini.https://github.com/simedw/ coco-gemini, 2025","venue":null,"work_id":"1b2d5795-8ab9-4928-bceb-aadd8d2277f5","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:879318efb6e1c4e602b411ea39f79d5da4f0779250c5566ba38e2d2486485f90","observation_id":"df80284b-8a5d-4368-a0b1-c228898df0d1","resolution":{"observed_at":"2026-07-08T20:45:37.276645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.309410Z","title":"Multi-modal hallucination control by visual information grounding","venue":null,"work_id":"9ab66f95-80c8-4a0f-a59c-7b23a63ed008","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:4c58a75057830bb577d5d89813d46dd87f1a64dbe99ee2f351b42409b66fa2ed","observation_id":"67814fe2-40d1-45b6-8552-1652a7985482","resolution":{"observed_at":"2026-07-08T20:45:37.310543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.278868Z","title":"TALL: Temporal activity localization via language query","venue":null,"work_id":"4d209c3a-7ecd-4266-b459-0b3921598b86","year":2017},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:87340656cc5448c205f9c5d3c95436fdd3242b154df4fba3c9fb521db4e58c71","observation_id":"eb0b4114-781a-463c-a197-5e1d513d4e63","resolution":{"observed_at":"2026-07-08T20:45:37.280076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:8b78962044e9e8cafdfdf4ace6d7987255e5e9dbe758f490a19187d43aba4df9","observation_id":"52dcb6a6-ebf9-4184-aaed-7871279815dc","resolution":{"observed_at":"2026-07-08T19:55:33.902913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.307772Z","title":"Gemmeke, Daniel P","venue":null,"work_id":"9dff69a6-93ea-444b-b99e-dae0c3539b6e","year":2017},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:314d29bf5e673226290150f47f21e5f94dd2c8cfbb3b4f5d6d50cddb4f0b46b7","observation_id":"92ea6d40-80d9-4b7e-9eb1-b033106f1a52","resolution":{"observed_at":"2026-07-08T20:45:37.308839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08128","last_updated":"2025-07-28T22:53:43Z","snapshot_observed_at":"2026-08-17T22:20:20.496099Z","submitted_at":"2025-07-10T19:40:21Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","version":2},"cited_work":{"arxiv_id":"2507.08128","doi":"10.48550/arxiv.2507.08128","metadata_source":"pith","pith_arxiv_id":"2507.08128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models","venue":"cs.SD","work_id":"67c2892d-8e27-4da1-8198-71c48e673e96","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/2507.08128","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:24d4979c4792939c05b7c918643e27330aba6b2913c7166c26ad2b83d952420b","observation_id":"3f087581-5dfa-440e-a7ca-ef0f46246b8d","resolution":{"observed_at":"2026-07-08T19:55:33.901819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.285802Z","title":"DAMRO: Dive into the attention mechanism of LVLM to re- duce object hallucination","venue":null,"work_id":"baf53c16-b6c0-4241-a520-61869c0a647b","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:4488b67849642cb25b9a07029bd1fdaa5932efd643f7c731c055588af1e02d8e","observation_id":"c0cc97b4-24f1-4ba0-ad02-2566d353699b","resolution":{"observed_at":"2026-07-08T20:45:37.286983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.316374Z","title":"Making the V in VQA matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":"bbb0c623-c963-4d54-a24c-4c34deef5cfa","year":2017},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:24c228ed5445f6b3a41c2de3f77cc03b4a312f6ba2593ed34ad4c188318aa3da","observation_id":"be4929bb-018b-4874-93be-351e5d8346ac","resolution":{"observed_at":"2026-07-08T20:45:37.317666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.304488Z","title":null,"venue":null,"work_id":"56b24844-b2a6-4ad9-ab76-25b3faebf548","year":2021},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:181fa875a53b5e3e04774b72af51c9a1090ed70158eee43932c2bf3263bfb893","observation_id":"a4eff65d-50b6-47a3-b525-57bcfdd5b2ad","resolution":{"observed_at":"2026-07-08T20:45:37.305482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.282201Z","title":"OPERA: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"e5903906-50f5-4f2a-a938-1536d9148ad0","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:a9e56d7a2286df84a88e8a62e2164440cf8f0103ea6448fb9e54d959b4489d0f","observation_id":"6b426b24-5376-44d6-bb0d-fdd9f36d3f9a","resolution":{"observed_at":"2026-07-08T20:45:37.283399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.289251Z","title":"Interpreting and editing vision-language rep- resentations to mitigate hallucinations","venue":null,"work_id":"81c187a4-d8bb-4bc9-9813-643bd82766cb","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:8c4d286aa36d34cbf92450528ec0843256febb31303952b3f2877bc9ca0a56ca","observation_id":"54ddb34c-2b88-45bb-9f4d-3ee8ef27d513","resolution":{"observed_at":"2026-07-08T20:45:37.290443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.283915Z","title":"Devils in middle layers of large vision- language models: Interpreting, detecting and mitigating ob- ject hallucinations via attention lens","venue":null,"work_id":"79b1a532-e020-40de-a2af-24d76f955ff5","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:87224b3243a34d677081ef3c392b08ccc4a14bcd36489c61038a836de186f0a7","observation_id":"324b8e7c-c3b1-4a52-ad62-526928ef1beb","resolution":{"observed_at":"2026-07-08T20:45:37.285189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.306012Z","title":"Shamma, Michael S","venue":null,"work_id":"c0dc4fbb-2727-44e6-aac1-6f9b217d9095","year":2017},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:a102460bc8bb93c126efa8016e929591a342881e01ee2ad5cc94816331a6d71d","observation_id":"229bcd6c-8178-4afd-8a8c-ce2525cfcc1c","resolution":{"observed_at":"2026-07-08T20:45:37.307082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.292731Z","title":"Berg, and Mohit Bansal","venue":null,"work_id":"75529ac6-5d83-47cf-9c12-5a2f0c4cdb65","year":2021},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:03da532ea6043b96fa11b9e7442630a1cb48b3be531f26e41e7110ddd99eba45","observation_id":"05d4d1e9-b467-4b78-96f3-624df10f30b7","resolution":{"observed_at":"2026-07-08T20:45:37.293761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.267377Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"8e359077-082a-4ae1-940d-e8edabb90cba","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:e9eace4074eb6db02cc9bdd904f401cfdedb1f2337d85f6dff8d2195859307fd","observation_id":"3c7a3251-c031-4d6a-9865-6bf63d160993","resolution":{"observed_at":"2026-07-08T20:45:37.268615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.299324Z","title":"Grounded language-image pre-training","venue":null,"work_id":"5ce2df14-644a-4c5e-bd4f-9f10b6bf7a08","year":2022},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:0331229b4413d8fd1a4b3d4ff495ded98b5acc4602d9b5b311526b5b77dd4b10","observation_id":"62a7be5d-a2b1-4828-9052-a9cf2542b54a","resolution":{"observed_at":"2026-07-08T20:45:37.300407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.280609Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"8487f60b-95d1-43cb-8eb4-2b2c8d7baa86","year":2023},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:00e4f740e7079eb3610b61662e8c7c0a0b8e61bafd015c1ecf022971a5840c01","observation_id":"8870ead8-958a-473e-af59-edec0dd466d6","resolution":{"observed_at":"2026-07-08T20:45:37.281676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.262219Z","title":"Lawrence Zitnick","venue":null,"work_id":"c47ce4ba-e41d-41bd-98b5-80f99640a6eb","year":2014},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:214330763fc399ec1e4816b04b19bb1c6831c07c8deac0b10f47edeb85e68618","observation_id":"bac235d7-7159-4f89-868b-7e955c3dcbca","resolution":{"observed_at":"2026-07-08T20:45:37.263281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.311075Z","title":"Grounding DINO: Marrying DINO with grounded pre-training for open-set object detection","venue":null,"work_id":"73fe405a-e265-4ead-b0ee-31a9368b6511","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:3f55f3bd268161ee54529547d0e2b51284913f03dea716086e6079250d1028e7","observation_id":"8dd7a3de-7b9d-4f7f-aba3-ae3fc92ce1ae","resolution":{"observed_at":"2026-07-08T20:45:37.312378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.260322Z","title":"Paying more atten- tion to image: A training-free method for alleviating halluci- nation in LVLMs","venue":null,"work_id":"52160533-f864-495e-ba87-d768edfb4f0f","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:03a88e2b31fdebde2cb1408f90529436dfbadd60b0316f42adec609300fe07ec","observation_id":"535ec38c-64a7-4aeb-b415-ca87ea3989d2","resolution":{"observed_at":"2026-07-08T20:45:37.261517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.312961Z","title":"MMBench: Is your multi-modal model an all-around player? InECCV, 2024","venue":null,"work_id":"01e34389-c01b-4ace-a9e3-c7c4d7cac158","year":2024},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:1bacf10eee5da403f89199628984a87fbdc39a456d9aedfeb4d28a0a2d2abf3d","observation_id":"c5c98b0b-11c7-46c1-a9ae-c10bdc58afcf","resolution":{"observed_at":"2026-07-08T20:45:37.314104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.287522Z","title":"Simple open-vocabulary object detection with vi- sion transformers","venue":null,"work_id":"e6d8471e-6425-40cb-8ce9-93f5e39f5b67","year":2022},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:92331dec82c47a2c71fe3b0395f6d8731bdebb94b110b57120b82c2d450fe4f8","observation_id":"142b4287-43b9-4fcf-9dd3-77db617e1d8e","resolution":{"observed_at":"2026-07-08T20:45:37.288680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.295944Z","title":"Query-Dependent Video Represen- tation for Moment Retrieval and Highlight Detection","venue":null,"work_id":"d72fb04e-d143-4997-a016-ea11ce285ef8","year":2023},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:1c2ac5293d4a49beedb6d02cf38245a8a8a8f0a6f1fb6e787b87e55acd67de87","observation_id":"1b3ccc82-5771-4cb9-adb4-dc273502c279","resolution":{"observed_at":"2026-07-08T20:45:37.297122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.297709Z","title":"Verjans, Phi Le Nguyen, and Vu Minh Hieu Phan","venue":null,"work_id":"cf52193c-0400-4567-99ec-1680faff795b","year":2026},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:2d2b04ef9c63594d603d4a0bc436d8b56e3f8440ace98a738a13f43ea2798764","observation_id":"cf384d7b-f0d5-46c9-930c-b400c45887cc","resolution":{"observed_at":"2026-07-08T20:45:37.298811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.277171Z","title":"GLSim: Detecting ob- ject hallucinations in LVLMs via global-local similarity","venue":null,"work_id":"5a6814df-f381-4041-b508-44b9d9d537c5","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:44af8767e15b8d74f0f610d4502cdd29c0d4842923ff0e435b88a1ae6d02d1a9","observation_id":"281d80a6-1c69-4e76-8a24-9ef93bbb5bf4","resolution":{"observed_at":"2026-07-08T20:45:37.278345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.294283Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":"57727c33-e2f8-4a89-be3a-02f3d3821d66","year":null},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:73cb20e9a18b26216b4ea821d5f4191888387098d5824d9b95652b0026c525c3","observation_id":"156f1f7c-eabb-4f3c-9bdb-8b84acedf8f2","resolution":{"observed_at":"2026-07-08T20:45:37.295387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.302808Z","title":"Beyond logit lens: Contextual embeddings for robust hallucination detection & grounding in VLMs","venue":null,"work_id":"c1ede181-45cd-44b1-8487-57d71ad7606c","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:97f1d7679343f909555c8f21d2febb3175269a97355cbd553170bd77152d8d90","observation_id":"ba38589b-a41b-4b48-ba66-9c86bb97a9ba","resolution":{"observed_at":"2026-07-08T20:45:37.303962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.301103Z","title":"Effective pre- training of audio transformers for sound event detection","venue":null,"work_id":"e3783f73-3bb6-47f5-9b5f-4e49a9716d3a","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:2dbb91903def3b9b1ae0b30385fbe7073cf6385e0d761fc8eb57d7fedaffac86","observation_id":"6e499d5b-46c1-46ad-aad6-93a29f9e9197","resolution":{"observed_at":"2026-07-08T20:45:37.302250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:2fa519c51ef9593715f07729627b9040a49e3dc5518e4cbe901a834168d0e7a4","observation_id":"4c1a8bf1-36d2-4fdc-beac-e8c39e32b0f5","resolution":{"observed_at":"2026-07-08T19:55:33.897014Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.314687Z","title":"Berg, and Tamara L","venue":null,"work_id":"6e24aaaf-70a5-48f2-bc4f-1bbbf5d90fb8","year":2016},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:02b8b6db62dd98e156dfc00ad304f53d4200e20019a24173c55b723470c2672d","observation_id":"c01575d3-9dd5-44a0-8ce1-cc07aa9206cf","resolution":{"observed_at":"2026-07-08T20:45:37.315775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:45:37.273933Z","title":"bbox_2d\": [x1,y1,x2,y2],","venue":null,"work_id":"ddfe3705-a911-4a44-993d-27e1d40d2f68","year":null},"citing_paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T19:49:20.020874Z"},"links":{"citing_paper":"/paper/2607.05978"},"observation_digest":"sha256:d1bb31c621518ca4fff42136756e90fb4ee14ed6ff76c34aa36bc7d6c0272cbb","observation_id":"a484ad0f-67ce-4a29-a1c8-e12d11fc78e6","resolution":{"observed_at":"2026-07-08T20:45:37.274934Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05978","last_updated":"2026-07-07T08:10:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T13:35:49.302451Z","submitted_at":"2026-07-07T08:10:57Z","title":"Propose and Attend: Training-free MLLM Grounding Confidence via Multi-Token Localized Attention"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":6,"verified_fuzzy":30},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2607.05978."}