{"as_of":"2026-08-19T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83418a2ffecc27b0eaef2273f112e08eb34a38d1ee12a61859f4f0688fa1d284","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:27:36.967307Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T09:32:15.287630Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T06:54:20.297814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"cited_work":{"arxiv_id":"2504.15619","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.15619","snapshot_observed_at":"2026-06-30T06:54:20.297814Z","title":"Adavip: Aligning multi-modal llms via adaptive vision- enhanced preference optimization, 2025a","venue":null,"work_id":"d23dbd2d-88b3-4989-80db-de064ee137a8","year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T06:52:55.368187Z"},"links":{"cited_paper":"/paper/2504.15619","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:6de20f01a8e96794db3b01af9e2468c636f7df3aeef6e66456454585f69a7d66","observation_id":"96fb79cb-15f2-49a7-a315-a5403f276793","resolution":{"observed_at":"2026-06-30T06:54:20.299776Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15619","snapshot_observed_at":"2026-08-02T09:32:15.287630Z","title":"Adavip: Aligning multi-modal llms via adaptive vision- enhanced preference optimization, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T09:32:15.287630Z"},"links":{"cited_paper":"/paper/2504.15619","citing_paper":"/paper/2606.30420"},"observation_digest":"sha256:dd0e1c7f7ef4cef829bff5f88b650defebcb0340260eb66f9121f85a9a09abd0","observation_id":"d05ecd30-59cf-4ae0-81dc-2c38046ca202","resolution":{"observed_at":"2026-08-02T09:32:15.287630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15619/citation-record","integrity":"/paper/2504.15619/integrity","json":"/paper/2504.15619/citation-record.json","paper":"/paper/2504.15619"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T11:27:36.775609Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.775609Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:25ca8bd89bb00020516803ddb5769bc1b69a1405269b427a0c57d9e7350afa9c","observation_id":"093899e6-7095-4e10-b223-4ddb7bcf3d23","resolution":{"observed_at":"2026-08-16T11:27:36.775609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.781271Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.781271Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a445c22984eadf4f3dccc9c376e5256d77effe1b4f86afde1f1b8d33b18ef1f7","observation_id":"92150601-f9d1-4c86-bdd9-6a97ca3e59e7","resolution":{"observed_at":"2026-08-16T11:27:36.781271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.786299Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.786299Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a4a16aba228aed6cbb3727b68dad0281ddfa6c0c87a8d504a1de559696b44282","observation_id":"719192e5-89df-4588-bac2-e43d57f8e384","resolution":{"observed_at":"2026-08-16T11:27:36.786299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09215","last_updated":"2024-11-07T18:30:53Z","snapshot_observed_at":"2026-08-16T13:43:17.896821Z","submitted_at":"2024-06-13T15:16:11Z","title":"On Softmax Direct Preference Optimization for Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09215","snapshot_observed_at":"2026-08-16T11:27:36.791252Z","title":"On softmax direct preference optimization for recommendation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.791252Z"},"links":{"cited_paper":"/paper/2406.09215","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a232a3c757c384c92010778b7e44792be5d9d1d2c673b1018e3d68d4fe207162","observation_id":"d81c4bbe-ef1f-4e95-a20b-9f4be29fe3b7","resolution":{"observed_at":"2026-08-16T11:27:36.791252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.795638Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.795638Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:ab0d310b88d38c86687037acd7db957e6bb6a6fa7bb2d411285f0b8c72cc0839","observation_id":"bb9c2a54-d787-4175-94d9-5ca5817a5c73","resolution":{"observed_at":"2026-08-16T11:27:36.795638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14148","last_updated":"2025-04-21T04:04:53Z","snapshot_observed_at":"2026-08-17T22:52:12.735201Z","submitted_at":"2024-10-18T03:34:32Z","title":"Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14148","snapshot_observed_at":"2026-08-16T11:27:36.799901Z","title":"Fine- grained verifiers: Preference modeling as next-token pre- diction in vision-language alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.799901Z"},"links":{"cited_paper":"/paper/2410.14148","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:4e43a71306c22b3f892ff466b0dd4caf5228e6efe34fd6a76f408b082aeb716b","observation_id":"d04cb186-8fa6-46a8-80e5-ebef887297ef","resolution":{"observed_at":"2026-08-16T11:27:36.799901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T11:27:36.804737Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.804737Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:49dc72013696b55be25b1ca96fbdae53bb13b2012a8365b522c797ccc5d44476","observation_id":"3a17869f-2166-42cf-8746-51fd6f8a1e80","resolution":{"observed_at":"2026-08-16T11:27:36.804737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.809824Z","title":"Token pref- erence optimization with self-calibrated visual-anchored rewards for hallucination mitigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.809824Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:35c1b36c7a077ac186e0ac83d902e814bbd6e6ded9e79fe40d22f9133a21705a","observation_id":"95945a37-ba21-4a3d-baa5-fdab24ce670e","resolution":{"observed_at":"2026-08-16T11:27:36.809824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.645846Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"b6e22595-56c7-4f95-8d17-6aebd880e6f3","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.814777Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:c6bf54934a699ea45f9a8f71652e5b5f683dd75518315f005f81e9abf2f6fa16","observation_id":"a6d22f44-da87-4636-b64c-3c08af0b715a","resolution":{"observed_at":"2026-08-16T11:27:37.650484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.632105Z","title":"Vcoder: Ver- satile vision encoders for multimodal large language models","venue":null,"work_id":"3be50156-4330-4393-bebb-a7d85f474bab","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.819185Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a994af3f9c5dfde54cf15a575d477f3dedabca82b846c0490d7d1f6c40458a77","observation_id":"d8808e51-ce19-4561-ba05-82f0bd35a36f","resolution":{"observed_at":"2026-08-16T11:27:37.636582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.823599Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.823599Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:2ef52440a5393c95d35b56510e4c1b7a0db26962abecd1e43b568962ec15fcad","observation_id":"eed9db34-3573-4c79-9481-0aebebfa17fd","resolution":{"observed_at":"2026-08-16T11:27:36.823599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.609265Z","title":"Mitigating object hal- lucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"c4f2fcfc-8da2-4f58-9244-d309379a93ec","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.828357Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:1c30b97b5d8c548e7edcc3262babfbb1822f5a15ff6da037cae66456073ded00","observation_id":"7a39659f-7ac2-4425-9003-a4517094f08f","resolution":{"observed_at":"2026-08-16T11:27:37.613634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.595709Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"5bf6468e-2533-4d11-8f33-80f65175fcff","year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.832906Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:e53ca7f6edcd61906377da14f84258284e977222ac205d68f1f275543a791dcd","observation_id":"5a629912-dca5-4e7f-9a44-ec6495c14280","resolution":{"observed_at":"2026-08-16T11:27:37.600403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.581483Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"c98cea64-7326-46b9-a462-fec72e1ae361","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.837390Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:63c315b89ccf406732b005cdb65aece479cca28e28cf9c68937f5c0210482af4","observation_id":"4934d308-8fd1-44a2-b4de-e18754222cd3","resolution":{"observed_at":"2026-08-16T11:27:37.586286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.842748Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.842748Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:efcc5a8f766cf10ebd5088964e70837f44a6dc6192ab11c2d5188d1091035dac","observation_id":"82e1dca7-42f8-4e1b-a925-a5a10ba7aaf6","resolution":{"observed_at":"2026-08-16T11:27:36.842748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-16T11:27:36.846971Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.846971Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:053079659c78c905971a2ab6e01c1fbc00543cd368fa545ef20ae7e787dfbf63","observation_id":"424ef249-6884-4c4d-884f-fb2f98b8c06c","resolution":{"observed_at":"2026-08-16T11:27:36.846971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.851574Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.851574Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:c426eeaa581dee2e63d12145c1fa82d3909c3ff66edceb3c5e41740ffbd2fb93","observation_id":"130569f9-1b16-4e9e-8e42-4c1bcff895e6","resolution":{"observed_at":"2026-08-16T11:27:36.851574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01943","last_updated":"2025-02-11T03:55:29Z","snapshot_observed_at":"2026-08-18T11:17:17.595220Z","submitted_at":"2025-02-04T02:30:36Z","title":"DAMA: Data- and Model-aware Alignment of Multi-modal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01943","snapshot_observed_at":"2026-08-16T11:27:36.855648Z","title":"Dama: Data- and model-aware alignment of multi-modal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.855648Z"},"links":{"cited_paper":"/paper/2502.01943","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:f9d692ba5f132e90c796e4858adc902029954a6e60679d36542f4a33b0684a78","observation_id":"5f4a199b-33f3-482a-8863-026fdecfdc87","resolution":{"observed_at":"2026-08-16T11:27:36.855648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-16T13:50:07.192537Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-16T11:27:36.859960Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.859960Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:b50e389501bc4fef68577ababf4513c8cbddda2f66e854d680e4210fb745fc1f","observation_id":"125a8a78-1c1b-4aac-af6b-4f56387f5b13","resolution":{"observed_at":"2026-08-16T11:27:36.859960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.547812Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"643b1436-98fe-475e-81d6-c4e4d45ad4df","year":2022},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.865016Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:8f54f2f11b5ad83528aaba48c3d3b06c1b8c315b6ee6386efbce6d2115c0fdcf","observation_id":"23502d6e-736e-4c68-87de-ac85f7769eb8","resolution":{"observed_at":"2026-08-16T11:27:37.552804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.533817Z","title":"The analysis of permutations","venue":null,"work_id":"2e5f3e2e-dff7-4496-80fb-942a8429cbaa","year":1975},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.868685Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:24ad19f22adb5d5a5103286962432bb79a1dac540c25963bb20d4834cad79920","observation_id":"adad47df-3b0a-4954-9301-9987268c5d02","resolution":{"observed_at":"2026-08-16T11:27:37.538273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.872489Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.872489Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:5d9b98931f6c75a858ea50fceac44c0eec8d478aa31a4d93a85bab679eb32f92","observation_id":"dd965f93-ac32-4fd8-8348-4841393b0271","resolution":{"observed_at":"2026-08-16T11:27:36.872489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.510889Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"84a82144-0aaf-4b21-89ea-ccca60d033f5","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.876456Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:5fcaf7cac47b9f3194f7b38edc32443169eb0419a9c009e3fe47225967ebe436","observation_id":"e26f40fc-0a66-49a1-8279-52db45feb442","resolution":{"observed_at":"2026-08-16T11:27:37.515321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-16T11:34:00.114590Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-16T11:27:36.881296Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.881296Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:7243495a622bf448763727da64ccb3a52f7f10a2f54ae23b26d185ff279a1a2b","observation_id":"e19d75d0-46dc-46b5-b2e6-f4718afbb906","resolution":{"observed_at":"2026-08-16T11:27:36.881296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:27:36.885833Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.885833Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:f222e9d84b61182065831521935d8eccb082efe9f8c8101caa647fb1416048c4","observation_id":"3f03910b-e67d-4962-94b5-a4567d505901","resolution":{"observed_at":"2026-08-16T11:27:36.885833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.497098Z","title":"Objects365: A large-scale, high-quality dataset for object detection","venue":null,"work_id":"e89a7767-d94b-419c-93a6-22b06c9ffafd","year":2019},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.890601Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:cbbb5da84693e201b5b8bbb84a3b794bb9361231179334f549318c403c3d90ce","observation_id":"37f7f5e2-deb2-4bf3-a4a3-a7ad16d48696","resolution":{"observed_at":"2026-08-16T11:27:37.501824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.483046Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":"9fca0fc3-aa67-40b1-b01f-f7f52e3411f6","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.895020Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:fd9b517a1163ca10fac12f626f4b1c63da2fcb21c1051dbc98fb07cd59b6c679","observation_id":"1214fcfc-d56e-4ed2-9e45-9a34c45751bf","resolution":{"observed_at":"2026-08-16T11:27:37.487560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.468900Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"a677696d-0c45-4953-979a-109a3c1c929f","year":2022},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.899747Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:96e4544943e681d14190ff3207ad125f8331d3cfd4c2f53ffe3c080e0758ce7d","observation_id":"ee3e42fc-198b-4fbc-baa8-8b677aebf1ee","resolution":{"observed_at":"2026-08-16T11:27:37.473590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.454530Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"b7fd0fe5-88f5-4676-ac6c-c68173d64630","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.904069Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:1a998de0a6e148a5c677043975ef1b209fae290fc8c807e19bb49c05c020daa7","observation_id":"c1c23691-359e-4934-86a2-7da63f6ed46c","resolution":{"observed_at":"2026-08-16T11:27:37.459135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11839","last_updated":"2024-10-07T17:59:42Z","snapshot_observed_at":"2026-08-18T17:11:38.711653Z","submitted_at":"2024-06-17T17:59:58Z","title":"mDPO: Conditional Preference Optimization for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11839","snapshot_observed_at":"2026-08-16T11:27:36.908291Z","title":"mdpo: Conditional preference optimization for multimodal large language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.908291Z"},"links":{"cited_paper":"/paper/2406.11839","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:66a68eaaeebee2bf32cc21d8d526914426080431100ede8994d27e8fece591dc","observation_id":"2d99a1ee-41d2-498b-9578-1562c7ca1bd3","resolution":{"observed_at":"2026-08-16T11:27:36.908291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-16T11:27:36.912762Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.912762Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:09391be50c9d87e87fc45afcc41fda395a606711ab2a40c25093fa73fd5f1d46","observation_id":"7de03321-57d7-460a-8924-106a1a52e5c4","resolution":{"observed_at":"2026-08-16T11:27:36.912762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.441493Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization","venue":null,"work_id":"5fd6c0b3-d982-484f-abc6-a8b52b945338","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.917543Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:6025ecb562a2bbbecfa9f2596582347eadeb632c37780cbcbc5b5e394ad6cf9a","observation_id":"5f2e13fd-6b91-40ca-b3e9-fb4316cd8b43","resolution":{"observed_at":"2026-08-16T11:27:37.445952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.429347Z","title":"Miti- gating object hallucination via concentric causal attention","venue":null,"work_id":"10538607-efb9-444c-bbe0-057d26c681a1","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.921589Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:883d3545c5fac96ca2c58d4077728f24f50d2cf490805fe1e7f930d9524f1144","observation_id":"b1706a88-95c2-4dc8-91d8-c7a31db28773","resolution":{"observed_at":"2026-08-16T11:27:37.433369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.413796Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":"7cd7c413-dca2-4fb5-aaca-64d5deff214e","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.925145Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:541fe4b3786fc2ba88a45f21c67833be9c5308adc13bfc7d49281091e60d688b","observation_id":"543e52e2-b383-42e1-b31c-521ecae710f5","resolution":{"observed_at":"2026-08-16T11:27:37.419164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.398811Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":"59228e65-8dff-43f0-8e75-96fdc932314b","year":2020},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.928913Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:c451fdd6dced5acc925fc6b17d2edeb2c76743f002c80285dccd829e49f2afce","observation_id":"1b7b53f2-0ecd-44f9-8737-94a9d76baf2e","resolution":{"observed_at":"2026-08-16T11:27:37.403148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.383499Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional hu- man feedback","venue":null,"work_id":"84a044cd-25cc-4eb8-b90a-46e62b5d49d6","year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.932671Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:dfdd4e7eda309f6c1be83dca1ca683546403ce6926ab7c52728507cdfd550993","observation_id":"6ac5f39a-6808-4e98-a437-78bec96e61a2","resolution":{"observed_at":"2026-08-16T11:27:37.389025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:36.936265Z","title":"Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.936265Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:521c9b7a19d8260b6104310824ce786882b6108c1675cffbd4c3c3ebd30698d0","observation_id":"a5b3b0f2-d9a5-4cd6-b1e4-0139ba3583ec","resolution":{"observed_at":"2026-08-16T11:27:36.936265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.368826Z","title":"Less is more: Mitigat- ing multimodal hallucination from an eos decision perspec- tive","venue":null,"work_id":"cd4d3427-61c6-4b5e-8016-074038377b87","year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.940132Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:f94826fc9c2b04ff5f5873112c332539499c18fc925f657a662d6142c79749f5","observation_id":"73ad28ea-13da-4df4-b350-6544a29966c6","resolution":{"observed_at":"2026-08-16T11:27:37.373451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.354902Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object de- tection","venue":null,"work_id":"d3633487-006f-4553-a5af-6c3e9e427c8f","year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.943904Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:4f404fea1c0e3d60d1d2265b8311778ccaef121cffb199dfc49fc17b76ff982c","observation_id":"45faf425-0cfa-479f-8119-e2b3bd570cd4","resolution":{"observed_at":"2026-08-16T11:27:37.359000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:27:37.337824Z","title":"Automated multi-level preference for mllms","venue":null,"work_id":"bc81495f-8510-4216-b91f-992ae010852a","year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.948595Z"},"links":{"citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:ea6f134b088e5218fb23a7fee586a54ac94e90e8d58300687fe03672a5489a6b","observation_id":"01843850-9619-4c58-b617-ebe5e29f0e00","resolution":{"observed_at":"2026-08-16T11:27:37.344886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03514","last_updated":"2023-06-09T15:21:06Z","snapshot_observed_at":"2026-08-16T15:26:15.090405Z","submitted_at":"2023-06-06T09:00:10Z","title":"Recognize Anything: A Strong Image Tagging Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03514","snapshot_observed_at":"2026-08-16T11:27:36.953580Z","title":"Recognize anything: A strong image tagging model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.953580Z"},"links":{"cited_paper":"/paper/2306.03514","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:bce97806793aa8d3ae9db80b0535a189cf7f60b588b00b1348b17623a1a6e485","observation_id":"44b884ca-911e-4888-bdc4-d7fd8c394d63","resolution":{"observed_at":"2026-08-16T11:27:36.953580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-16T14:18:52.863427Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-16T11:27:36.958272Z","title":"Mitigating object hallucination in large vision- language models via classifier-free guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.958272Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:926c33249c64f47672b0be4ff5015dc405c72c3b6ac1e998e203511d0bf0faed","observation_id":"692784a0-41d9-449d-ae1a-f18255bc8761","resolution":{"observed_at":"2026-08-16T11:27:36.958272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-16T19:33:05.632918Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-16T11:27:36.962572Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.962572Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:a475add35ed090863de8b4b2b972121ed5c8892eccfbe0f6b4b19f445d76047d","observation_id":"e37eccb4-077b-490d-8871-adb8cb90c6ee","resolution":{"observed_at":"2026-08-16T11:27:36.962572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-16T11:27:36.967307Z","title":"Aligning modalities in vision large lan- guage models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:27:36.967307Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2504.15619"},"observation_digest":"sha256:9c45edfd68ea0c64d7c5f917d00bd6ce7980c5054da0a73d31da2b3643120db6","observation_id":"332e1d13-7462-41bc-a4f0-d5d64fe41616","resolution":{"observed_at":"2026-08-16T11:27:36.967307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15619","last_updated":"2025-04-22T06:19:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T11:35:04.116801Z","submitted_at":"2025-04-22T06:19:38Z","title":"AdaViP: Aligning Multi-modal LLMs via Adaptive Vision-enhanced Preference Optimization"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2504.15619."}