{"as_of":"2026-08-07T18:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6dedffaf3106b2d43868ec2e9b17735154be816213b72b11c384e8de79fca25","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:27:19.422402Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:07.037081Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17901","snapshot_observed_at":"2026-07-31T04:55:07.037081Z","title":"Postalign: Multimodal grounding as a corrective lens for mllms.arXiv preprint arXiv:2506.17901,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-07T03:16:22.730404Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:07.037081Z"},"links":{"cited_paper":"/paper/2506.17901","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:ee0face5780932cfac2fb856b30c51747ef65f4dd6906b7944b6ccf6e616a986","observation_id":"aabe33ca-8363-46f4-84c2-e6edcf9dd92d","resolution":{"observed_at":"2026-07-31T04:55:07.037081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17901/citation-record","integrity":"/paper/2506.17901/integrity","json":"/paper/2506.17901/citation-record.json","paper":"/paper/2506.17901"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:27:19.137072Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.137072Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:a9bfcf6f39c5b6dc72671bd17bc293e46ae3a1d88095f5b6ebc1da7ebd195ec0","observation_id":"273b3927-c791-4d73-ae2b-d1bc481b4586","resolution":{"observed_at":"2026-08-06T23:27:19.137072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T23:27:19.142549Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.142549Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:6bf826b36acee22458c12474d1db5fc0f7ff76b0dacf89768ca722c352f19fad","observation_id":"aa400c8d-d4ca-4635-95fa-5316f5e2134a","resolution":{"observed_at":"2026-08-06T23:27:19.142549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:27:19.147296Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.147296Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:4a65a2d87b479d31078be1378a4bb8162644b4c07ae368aaf64275a1cde26bb4","observation_id":"32175eb1-23fc-440a-8e50-8f07e4a0e8bf","resolution":{"observed_at":"2026-08-06T23:27:19.147296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:27:19.153898Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.153898Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8978c9c65a609b186f7bc89ab2ca2c39d4ba1acc5f081297892cd153b4194604","observation_id":"d4b16d96-276a-42a5-9803-672a34bcd566","resolution":{"observed_at":"2026-08-06T23:27:19.153898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.159315Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.159315Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:bf9241049f25e61190e3a4f427fd412dff3a81930bf383fe36db7fe2f97778fc","observation_id":"d19aa91a-eb45-4ff2-ad7c-43d7846ad7cd","resolution":{"observed_at":"2026-08-06T23:27:19.159315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.164043Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.164043Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f6050dd6d9e4b4824308eac76f107ac87e9092739ef6cfaae5b66a6b9ec7d7d0","observation_id":"ca2a5fca-638c-4e0f-9852-7cb5c097dad5","resolution":{"observed_at":"2026-08-06T23:27:19.164043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:27:19.168676Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.168676Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:b7dd876e5440722476a7b495f1d470c9205038d18c06f7be3b07905ca0c0d09c","observation_id":"f82fde58-886e-4f91-9968-e168b67e6bee","resolution":{"observed_at":"2026-08-06T23:27:19.168676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-06T23:27:19.173386Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.173386Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:9fb518698601653644ca98fc35ca62ad7e37c81da1d50e3104951bbadea7bc96","observation_id":"93ceceb7-6b52-404b-913f-734d14c999be","resolution":{"observed_at":"2026-08-06T23:27:19.173386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T23:27:19.178110Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.178110Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:386465f9321dce21fc8f1515604e6939f6bce78bd362d88b2da312939ec00c42","observation_id":"02ba2f93-d8a2-4594-a6b1-07d36ce67313","resolution":{"observed_at":"2026-08-06T23:27:19.178110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-06T23:27:19.182352Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.182352Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e523b63fb510a3f71c2f4da7ec530f0404576b682f8fe944ee57fd28e3388637","observation_id":"40e6b8fc-6543-44f4-93fa-f8dc726fa650","resolution":{"observed_at":"2026-08-06T23:27:19.182352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.186869Z","title":"The deluge of spurious correlations in big data","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.186869Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:901b194969be8c18aa61f7a2d81b6906cb9f4b112e7ededfb8d819d1433b73ab","observation_id":"bbe7b840-b758-452b-ad9d-111b7f59d2b0","resolution":{"observed_at":"2026-08-06T23:27:19.186869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.191298Z","title":"Spurious correlations in machine learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.191298Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cadb79be2414316f64a07f10469c353adbfcfaadc2ea444a9f9fe5eb566cd330","observation_id":"dd9ca390-6541-4b3a-9a8a-5272bd001bbe","resolution":{"observed_at":"2026-08-06T23:27:19.191298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.243206Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"5b31c66e-531e-469e-89a4-d7b94f010420","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.196105Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e993c532effe8bfa92a35ccc8648c0a54e841f676c83d3c301879472deebbe2d","observation_id":"48703dd0-3329-485b-9045-e787be222265","resolution":{"observed_at":"2026-08-06T23:27:20.248345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.229552Z","title":"Described object detection: Liberating object detection with flexible expressions","venue":null,"work_id":"f33c1465-b02d-48ce-9bcb-60bfdc04d18d","year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.200189Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:aef519ef8c6869a26259ece513d53298c83b67101e8af3da5230fcddbea8cc4b","observation_id":"52ba5597-4e00-4d45-bd0d-02cfdc97634e","resolution":{"observed_at":"2026-08-06T23:27:20.233649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.216099Z","title":"Mattnet: Modular attention network for referring expression comprehension","venue":null,"work_id":"bb7a96f7-cb44-466a-9d46-ca7239e6bcd8","year":2018},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.205034Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8628a2555331db442552ea5d8314c8f82ce28386758a7d5e6cccbf5ecd3bebbc","observation_id":"b42d05f7-f51c-4955-a2e2-1cbf62a10090","resolution":{"observed_at":"2026-08-06T23:27:20.220220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.203305Z","title":"A fast and accurate one-stage approach to visual grounding","venue":null,"work_id":"c52f5eff-063c-4cd1-8728-c1500407a60e","year":2019},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.209588Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:1dd454865d22f4c0b7b80feda73eb39b85ee8e21b66ce5b2196ef7f1105f90b7","observation_id":"9f7685f1-b46c-4210-9ca0-edab7be1a164","resolution":{"observed_at":"2026-08-06T23:27:20.207560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.190360Z","title":"Mdetr: Modulated detection for end-to-end multi-modal under- standing","venue":null,"work_id":"dd1d5cd9-59df-456c-888f-7e98bb36721b","year":2021},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.213891Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:b0a4bd8e5e8bb9b7ed9e8c860bd5fd9dddf12ee18084d72459e694b34a8c6fbf","observation_id":"a588206f-1b12-4e05-bdeb-c69053877f28","resolution":{"observed_at":"2026-08-06T23:27:20.194646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.176466Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre-training for open-world detection","venue":null,"work_id":"fda829e9-ef15-47a8-8085-22f64afc15e0","year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.217883Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:9b1c5f8a4e60ee896d9cce503f6e9e813d8260c0128c5283b3e65be3becc96cb","observation_id":"45b28f3a-55ae-4190-ad07-926b025c1485","resolution":{"observed_at":"2026-08-06T23:27:20.181167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.222225Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.222225Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5380088e937e475b25807a0a45dc914beec57a2b3b970b46fdd805cfe62feeaa","observation_id":"d3c8b111-2b48-48c6-ba44-67752411513b","resolution":{"observed_at":"2026-08-06T23:27:19.222225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.226753Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.226753Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:35fb792361ece05c531460f1efe425eef6885db7c7001590b004669c5227b6ec","observation_id":"18aadb9d-8643-4a34-9cc2-8673b052e883","resolution":{"observed_at":"2026-08-06T23:27:19.226753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.147357Z","title":"Phrasecut: Language- based image segmentation in the wild","venue":null,"work_id":"4e1ad604-91e7-499f-82f5-71a9c1745858","year":2020},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.230979Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:a52ea97950cd63268414eac47e0a38b473b64f612ef6e89a14e2eda902cccea1","observation_id":"0827b9be-23cc-4579-8685-d2ad90942133","resolution":{"observed_at":"2026-08-06T23:27:20.151548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.134685Z","title":"Advancing referring expression segmentation beyond single image","venue":null,"work_id":"718aa3f5-e965-458b-8e22-1e1418e3d1d7","year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.235705Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:4a4d5ce70a706cc626a459c253e46dd14833c3e4645ea74d74315145b81ab8c9","observation_id":"a711b74c-fd5d-4930-b514-ea8bfed4ece3","resolution":{"observed_at":"2026-08-06T23:27:20.138869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.121602Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"5eb28ef5-35ad-44b6-8aaf-f1ae0ad3c1f5","year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.239704Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:050610d1cc8022ed0c0a563ea4adce0bdeb74ee91e0cf912a912e37a36e7a759","observation_id":"a943a3ac-de6c-4415-8207-6933e1295116","resolution":{"observed_at":"2026-08-06T23:27:20.125731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T23:27:19.244352Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.244352Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:4e00db424670e3d55b2d96d31032bca9725a91bd4d913de7748530963bc16def","observation_id":"67ce0251-1079-440a-83eb-03fc44b7c557","resolution":{"observed_at":"2026-08-06T23:27:19.244352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T23:27:19.249169Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.249169Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8c59377bd20203a80610fdde4945e789219eaa8256c0790942b5951af2c1b35a","observation_id":"89fc4323-c67c-43ff-a2a0-cf1dfbfb5186","resolution":{"observed_at":"2026-08-06T23:27:19.249169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.106096Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"ef6b2f29-9f50-419e-b275-49c551812870","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.254479Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:ad7c69bd6703b8a4ee4384751563985bd3948406d447d305b8a99be0bf931986","observation_id":"e9eb3e5b-e6f3-4f26-84dc-86866fc8b19a","resolution":{"observed_at":"2026-08-06T23:27:20.111553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-06T09:32:33.122628Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-06T23:27:19.259475Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.259475Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f769e51c3d7f73dbec1c0f75ecc4cff32c6856e5bd755e68a6c10c033376f97e","observation_id":"49669868-d3c4-4eed-8c4e-67a765c3624d","resolution":{"observed_at":"2026-08-06T23:27:19.259475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.264438Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.264438Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5e418ea60deed2cef2c0e3a6a2e19b0be533a82a934c527122979cfe736d76f1","observation_id":"c608b4a2-7148-4b59-8f83-29cd6fb8de7a","resolution":{"observed_at":"2026-08-06T23:27:19.264438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.080762Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"4f9e5985-b141-400d-9784-52d3ddf861a1","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.268906Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8bc444553bb1cb16af1df59d0ac3bbe81e437d5ec432a07903e5e5df32a9a115","observation_id":"2df227a7-fe8c-42da-9e7c-5d795981635f","resolution":{"observed_at":"2026-08-06T23:27:20.085128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.274135Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.274135Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:73fd7771fc812f20cd62004b64d7fc7c4fb2681c13df3d4fd608a0962f0bc398","observation_id":"3d5202c9-d0da-4c77-b193-e2d61653cb87","resolution":{"observed_at":"2026-08-06T23:27:19.274135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.058857Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"bd8af02e-a018-4367-94d5-d43114182c2b","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.278494Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8b0204303a161883ce59e328e328a5f4ea9d8246490697e8e2e9d6fbfc161dc3","observation_id":"eac4a933-149b-4c56-8259-00a0d42a7e3a","resolution":{"observed_at":"2026-08-06T23:27:20.063536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.045415Z","title":"Ground- hog: Grounding large language models to holistic segmentation","venue":null,"work_id":"78ed46b0-80ea-422d-97d8-3fbf7ea5b30d","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.282891Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5a8f5c927ba6cfe96245aede4fac82fa6e4900674be2fbb7110cbc34822a7f65","observation_id":"c6ec7099-6cf0-421d-883e-b59151bb6fe6","resolution":{"observed_at":"2026-08-06T23:27:20.049650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.030928Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":"5951630b-032d-4c13-be1c-ed766217dc99","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.287227Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e7b0cee56526f417d075ee8842f3aa18fe8d159a7d5230cc67efdf8c661eaf36","observation_id":"0038e964-8c30-4998-bc21-3b7d57f2bec4","resolution":{"observed_at":"2026-08-06T23:27:20.035923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07362","last_updated":"2024-04-02T04:12:43Z","snapshot_observed_at":"2026-07-06T16:46:38.855912Z","submitted_at":"2023-11-13T14:26:24Z","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07362","snapshot_observed_at":"2026-08-06T23:27:19.291980Z","title":"V olcano: mitigating multimodal hallucination through self-feedback guided revision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.291980Z"},"links":{"cited_paper":"/paper/2311.07362","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f8917ead72ac10695c82250ff27b657b377b5804d1cb0c6ced5ee3fbed0d42f8","observation_id":"ffdafa19-6a83-46f6-8203-d7442500db88","resolution":{"observed_at":"2026-08-06T23:27:19.291980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.016046Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"480eda99-0b70-4989-a703-92d8b897b9a0","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.297724Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:1000fecae111901dea072de68828d32a4f4bb10c7b43c0e2da53b746691ed402","observation_id":"2d8a7ba5-f0f8-42b4-9f20-5a7d4346ee61","resolution":{"observed_at":"2026-08-06T23:27:20.020444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-07T09:16:51.378562Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-06T23:27:19.302520Z","title":"Halc: Object hallucination reduction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.302520Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:d0fec219c28fa9784eb2e77a99342dc097b52db31e535ab7ab7bb4518f1cb06d","observation_id":"8e69ed7f-7f4b-442c-afca-f7e6eafabd88","resolution":{"observed_at":"2026-08-06T23:27:19.302520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-07-06T17:36:56.979448Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-06T23:27:19.308057Z","title":"Ibd: Alleviating hallucinations in large vision-language models via image-biased decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.308057Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5a41c91da6026212d70c993f137f4cca97608eb66e9d6abcb365c7f4e35f3b72","observation_id":"a788739c-d432-430e-ab17-4578f08fca09","resolution":{"observed_at":"2026-08-06T23:27:19.308057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-06T07:24:09.040524Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-06T23:27:19.313207Z","title":"Mitigating object hallucination in large vision-language models via classifier-free guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.313207Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:ea3215caa33f8ebe960847d587f79d2b9dce972b35b02ba4904c4593e9d5b7b1","observation_id":"26c07d63-eb7f-4cfe-b766-28ba79cd7a93","resolution":{"observed_at":"2026-08-06T23:27:19.313207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15300","last_updated":"2024-04-23T09:32:25Z","snapshot_observed_at":"2026-07-06T17:34:32.617468Z","submitted_at":"2024-02-23T12:57:16Z","title":"Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15300","snapshot_observed_at":"2026-08-06T23:27:19.317381Z","title":"Seeing is believing: Mitigating hallucination in large vision-language models via clip-guided decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.317381Z"},"links":{"cited_paper":"/paper/2402.15300","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:23522ce91bb3152e3edd6bd6eb7199c7b24fb82836cf7fc23354f2b2a6a65cbe","observation_id":"941699a5-a68d-4549-b759-f20cd207bae8","resolution":{"observed_at":"2026-08-06T23:27:19.317381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-04T10:14:38.406056Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-06T23:27:19.322266Z","title":"Mllm can see? dynamic correction decoding for hallucination mitigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.322266Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:bff0e019ee2f691f01aa8a5be97c5e771b877606005c58681f2020ad2ed223ea","observation_id":"a0289201-04d8-4b11-abd7-52c0fd50dc5c","resolution":{"observed_at":"2026-08-06T23:27:19.322266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T23:27:19.327237Z","title":"Mitigat- ing hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.327237Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:52f44f10212d475e49f99562ee1f5a99d65238166250fc02c9a16f8fded6dbe4","observation_id":"83809ade-bc12-4f4c-a9f3-9d932fe0c3fa","resolution":{"observed_at":"2026-08-06T23:27:19.327237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.331587Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.331587Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8a8728bc9a18d3a034e61f01badb27eea7166fd97c107ab76fd3016af74a7efd","observation_id":"9266776b-4b02-4827-9325-d3ce05895f3b","resolution":{"observed_at":"2026-08-06T23:27:19.331587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.994630Z","title":"Mitigating fine-grained hallucination by fine-tuning large vision-language models with caption rewrites","venue":null,"work_id":"01f93e2e-3070-4fb5-b12d-1d854337360d","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.335920Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:fb6ee38aeb04bcb536a9e6a35d2ec77056c8f4b5eb1f7d1e504e5cb230aa57c9","observation_id":"44f50dc7-c9ee-46c5-a2bb-9acd531102e8","resolution":{"observed_at":"2026-08-06T23:27:19.998872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-07-06T17:33:58.900451Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-06T23:27:19.340811Z","title":"Less is more: Mitigating multimodal hallucination from an eos decision perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.340811Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c24715c959f6d2876b82bb5f6e1ed34870efef15dfdfc934910d3e957ad2a681","observation_id":"5a4157b9-c626-4e58-ae53-43ce1a26264a","resolution":{"observed_at":"2026-08-06T23:27:19.340811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-07-06T16:53:51.485946Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-06T23:27:19.345738Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.345738Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e86846a5503b0506cd0d3813b0e362cd8942028b7d8225cb43a96ea51d3623ed","observation_id":"a79bad53-b962-41ef-921b-072ee2ab4e2b","resolution":{"observed_at":"2026-08-06T23:27:19.345738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-06T23:27:19.350818Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.350818Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:7b2549b196446e8e5de2a7cea9f4bfa0637b94717609b8eb07e2a4a81a53ae80","observation_id":"c32024ec-ed48-4892-8f1a-7e24be6b056e","resolution":{"observed_at":"2026-08-06T23:27:19.350818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.980934Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"f60cd4b2-3273-4b2f-a144-bef117b78daa","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.355853Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:3cc25689aac1727951ef266df70c39bd3dfe46e5eda4cb8e8b0dc7a790485dce","observation_id":"2e1ece5e-0ad4-4f77-827f-bbcf6daad7bb","resolution":{"observed_at":"2026-08-06T23:27:19.985299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T23:27:19.360031Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.360031Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:799bde960e2c8c0efac3767407aef90633e621f4ee3232f6b61662f62e2d1594","observation_id":"73579177-224d-48bb-b450-acc716d508dc","resolution":{"observed_at":"2026-08-06T23:27:19.360031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:27:19.364377Z","title":"Mul- timodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.364377Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c1f2d2b5504a8f9381b7a5fac18d29d782cccd62479713364ebf25e43198fb77","observation_id":"df92342c-82be-4b17-ab21-c721e7ac7c18","resolution":{"observed_at":"2026-08-06T23:27:19.364377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.368667Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.368667Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:6a58689ef58e34ba0aef52aa639e6023db2d28237a5d15562f4f94e2a316ed99","observation_id":"270c8a6e-257e-4f8a-88e7-8247fbfbe69f","resolution":{"observed_at":"2026-08-06T23:27:19.368667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.373049Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.373049Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:0d328cb17f391d10fba3a16d65a6e19835e6344ac5b88f15b66df85fe97d2250","observation_id":"a16614ee-0a09-4571-a35c-29ce190a0800","resolution":{"observed_at":"2026-08-06T23:27:19.373049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T23:27:19.377682Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.377682Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:721e65a0f78dda949d1951c6003133c4065a833631a89cf0ee670f69fa2726cd","observation_id":"6087d896-7570-4182-b910-32cb740d880a","resolution":{"observed_at":"2026-08-06T23:27:19.377682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.949034Z","title":"Haloquest: A visual hallucination dataset for advancing multimodal reasoning","venue":null,"work_id":"d2cef9d3-35ce-42c3-b27b-38db7ed0a69c","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.381749Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:19df38099083922d450f08f76c9e7d1a5f008cf67fdd03a1053478e1314556eb","observation_id":"721e8b60-a827-4b75-bf89-3337f723d851","resolution":{"observed_at":"2026-08-06T23:27:19.954610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T23:27:19.385833Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.385833Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:80a71fc4a591a3b6373f51996f8ceba5265c7b70d8beb1140698a50b90c26151","observation_id":"8cc0add7-bea0-48fe-baad-d63090dd7ee1","resolution":{"observed_at":"2026-08-06T23:27:19.385833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.390047Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.390047Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:995816be10d7baaaa1d75ef47ca839c7a3ce1c9be393a34cffbe3f225f774125","observation_id":"c82111ec-6b2e-4b60-9ff0-465307f7a97b","resolution":{"observed_at":"2026-08-06T23:27:19.390047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.395003Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.395003Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:a66863ed0ecb494b2700c9682b44b0b20057922dd2d58dc520ebc21e07a05cb5","observation_id":"9220180b-39ae-4622-aa9e-460ed9cef1f2","resolution":{"observed_at":"2026-08-06T23:27:19.395003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.918114Z","title":"A survey of multimodel large language models","venue":null,"work_id":"61e191b9-e91d-4946-be81-9ef5c4248af3","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.399460Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:8460dfa0ff32d15624bb0a91aa54da4cfde51b59df8d17e36e265b868702fcc4","observation_id":"4ca48f0e-6a07-4bc5-ad2c-1bd431309bfb","resolution":{"observed_at":"2026-08-06T23:27:19.923518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.403801Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.403801Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:23bb3a566dcd57bd080e25e7f05077eb68d6d503fa8a016ad8b5db278c8f470b","observation_id":"be649093-e7c6-4ac7-bd39-c3a49928230a","resolution":{"observed_at":"2026-08-06T23:27:19.403801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14141","last_updated":"2024-03-21T05:36:25Z","snapshot_observed_at":"2026-07-06T17:48:03.807374Z","submitted_at":"2024-03-21T05:36:25Z","title":"Empowering Segmentation Ability to Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14141","snapshot_observed_at":"2026-08-06T23:27:19.407889Z","title":"Empowering segmentation ability to multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.407889Z"},"links":{"cited_paper":"/paper/2403.14141","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:b13f02229405d5d43bf4149c63d592c7020c127f8cc1de0d7f082868cd74df81","observation_id":"517d6065-62a0-40aa-91b7-816888cdbd26","resolution":{"observed_at":"2026-08-06T23:27:19.407889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T23:27:19.413192Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.413192Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:151adea4c82a0c2ba1e5b06d7a77207904f73bea7e57d876a72201d806fa3f60","observation_id":"5d59454f-1ad6-49e5-9138-13c7cecfad0e","resolution":{"observed_at":"2026-08-06T23:27:19.413192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T23:27:19.418235Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.418235Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:496d328ca3d43c1d465924da62e8d41c136041c3093da392d7c7799009e7ebbb","observation_id":"e0cc1135-b213-4530-bd64-d317a063904d","resolution":{"observed_at":"2026-08-06T23:27:19.418235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.893339Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"3c959beb-e359-4357-9da0-939dc074940c","year":2025},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.422402Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f760699c518150ac3d2291f684825a2518abd90aa6dd666d74cc9c85dd7f2077","observation_id":"b6a2fb75-2e9a-4ac6-b8cc-131aba5b33ac","resolution":{"observed_at":"2026-08-06T23:27:19.899780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T09:17:13.426784Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2506.17901."}