{"as_of":"2026-08-13T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc33e75d08279a4e1f4e424631bcd6304a3cd31db467e31251a52ce46a5b3fec","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:58:43.424797Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14797/citation-record","integrity":"/paper/2411.14797/integrity","json":"/paper/2411.14797/citation-record.json","paper":"/paper/2411.14797"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.868877Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":"1d31b0ee-7c56-44d6-af25-dfa4ca67716f","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.711922Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:86ae923b835e978ee8eaeaf0d4c39d8d03d04a72622d2b812c17485f9c059573","observation_id":"216260a6-88c1-4992-b5d7-7eb67303aaa8","resolution":{"observed_at":"2026-08-12T14:58:44.874415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-12T14:58:42.716829Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.716829Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:624274f248fff3da50d0982ad414b7a04f2b8d5a1855b31a5adba90b5f6f5ec0","observation_id":"dd7b815f-e7c0-4a0d-b68a-e89f0ae32aad","resolution":{"observed_at":"2026-08-12T14:58:42.716829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.744185Z","title":"Self-play fine-tuning converts weak language models to strong language models","venue":null,"work_id":"7977dba4-42d5-4ba0-99f8-7a5859e858f6","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.721830Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:5625931779df4a476038a56a833074a356e060a93404bc0732ea716eecd02766","observation_id":"3228bcd9-5962-426c-a75d-b0cfe8b77cfc","resolution":{"observed_at":"2026-08-12T14:58:44.796661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T14:58:42.726082Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.726082Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:01ac78f596e4ffd0cc0d98c35e36ce01f6fb0a35ad5d07f2711cd6afb55ddf3d","observation_id":"b4e405fd-7802-465a-b135-fa84d92fe807","resolution":{"observed_at":"2026-08-12T14:58:42.726082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.731110Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.731110Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:774684585f9f5d8b75a560af36fd232c581a149cef98bddf14796dcd84ad3ab1","observation_id":"d7adcc2f-a2a2-4e3f-be14-bc214a52c496","resolution":{"observed_at":"2026-08-12T14:58:42.731110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.623935Z","title":"DreamLLM: Synergistic multimodal com- prehension and creation","venue":null,"work_id":"343262cb-ed81-4731-b59c-09953943bf3d","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.735944Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:a3c0cb1c6d0f2dbc5a51db0467272b23e72ce3e33e189aafeb9babea7b073548","observation_id":"d7bd5977-be98-4522-9546-98d7487d143d","resolution":{"observed_at":"2026-08-12T14:58:44.676044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-13T00:35:56.015163Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-12T14:58:42.740552Z","title":"Towards analyzing and understanding the limitations of dpo: A theoretical perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.740552Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:2a13bae031cc4910a346ccbd58554e91652967fc909633daf65c9f52e9c4da22","observation_id":"6fb41568-fb5b-43c1-93ad-7c7ab2d28a3e","resolution":{"observed_at":"2026-08-12T14:58:42.740552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.575094Z","title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"798e0210-7bb5-471d-a548-c12196719c2b","year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.781559Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:bf23735d5291bf9c9fe90033cb039a01abaf861dea72d63f6292722a4f8f1434","observation_id":"60aff75b-b0e4-404a-9576-bd5797658670","resolution":{"observed_at":"2026-08-12T14:58:44.592976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.863703Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.863703Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:2685a0ccc7ac3f3c2cebc23fafc5cbd6c96c6cb1a37391fecc5930851a8a5ec8","observation_id":"c9148c5a-5ee2-4f7d-b2e3-1c9ce62084fb","resolution":{"observed_at":"2026-08-12T14:58:42.863703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10884","last_updated":"2024-11-05T05:13:13Z","snapshot_observed_at":"2026-08-13T04:17:21.391762Z","submitted_at":"2024-02-16T18:42:08Z","title":"Multi-modal Preference Alignment Remedies Degradation of Visual Instruction Tuning on Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10884","snapshot_observed_at":"2026-08-12T14:58:42.961623Z","title":"Multi- modal preference alignment remedies regression of visual instruction tuning on language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.961623Z"},"links":{"cited_paper":"/paper/2402.10884","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:025a23f1a8ed47151ebd9e603139025391749f295ae26c9e6c3b22225936b3d5","observation_id":"afb2b299-70bc-4c87-a29e-5d634b8226a5","resolution":{"observed_at":"2026-08-12T14:58:42.961623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.966247Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.966247Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:1e0b271f712182543bff4cf3b02bf51a0cf0d5f5dc91e76958c756a981eb51a8","observation_id":"67336aec-9136-451a-a5fc-e9949679a539","resolution":{"observed_at":"2026-08-12T14:58:42.966247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.538869Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"c5f7e79e-07d6-4a05-a5f4-2e06f3e0ff93","year":2014},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.970537Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:01b884bec70130038e7f5f8da353ca5d0853a5bd8f9aaa43c7bd9ba6d9dd76f8","observation_id":"ca51b88d-cb91-4471-a5e1-e991a12a02ff","resolution":{"observed_at":"2026-08-12T14:58:44.544074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T14:58:42.975249Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.975249Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:e73d158d087c7565957ae116dbac345536ce09cbbbdbfc11bd583109e82e3c37","observation_id":"af73828a-48da-4410-ab60-3ae07928687a","resolution":{"observed_at":"2026-08-12T14:58:42.975249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:42.980350Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.980350Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:696f15f5f7fc30fe3267e10db3d8ad5d91bdbd537592f1f91a073a47e2ee6f89","observation_id":"6780e922-21a2-4532-b766-7fd447b1d05d","resolution":{"observed_at":"2026-08-12T14:58:42.980350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.513121Z","title":"Visual instruction tuning","venue":null,"work_id":"e7da0b7d-b923-429c-b901-ba693bd855e0","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.984357Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:20dd0136beaa4e5f9ec4eebc45fa5c36f0c81298ea7bbb6a47c8aa94a5aa8d46","observation_id":"f2f0c405-731c-449b-9866-dd977f7744f6","resolution":{"observed_at":"2026-08-12T14:58:44.518424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T14:58:42.989080Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.989080Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:69b77eaff8c40bc7c880512fdcf0305d10263120a1d2219930bcbe2bd3bf4311","observation_id":"d472d0a2-332d-4488-a741-661c935fcb61","resolution":{"observed_at":"2026-08-12T14:58:42.989080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16436","last_updated":"2024-12-04T08:15:35Z","snapshot_observed_at":"2026-08-12T23:57:54.839711Z","submitted_at":"2024-05-26T05:38:50Z","title":"Provably Mitigating Overoptimization in RLHF: Your SFT Loss is Implicitly an Adversarial Regularizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16436","snapshot_observed_at":"2026-08-12T14:58:42.993918Z","title":"Provably mitigating overoptimization in rlhf: Your sft loss is implicitly an adversarial regularizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.993918Z"},"links":{"cited_paper":"/paper/2405.16436","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:4a0bc9bab9ced519b9a9bc249124db5862689b68bee7c47ba9bfff284b39e960","observation_id":"a30925e4-dab7-415a-a62f-7d9533e6f59d","resolution":{"observed_at":"2026-08-12T14:58:42.993918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17931","last_updated":"2024-05-28T07:53:40Z","snapshot_observed_at":"2026-08-12T23:56:25.584091Z","submitted_at":"2024-05-28T07:53:40Z","title":"Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17931","snapshot_observed_at":"2026-08-12T14:58:42.998808Z","title":"Online merging optimizers for boosting rewards and mitigating tax in alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:42.998808Z"},"links":{"cited_paper":"/paper/2405.17931","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:caa53240c897df2846427b396b7f2068bd9dcaa710cbd1c0c24164ed2306f572","observation_id":"4a149c74-bc1f-48bd-bcf7-914f3eab9554","resolution":{"observed_at":"2026-08-12T14:58:42.998808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.005337Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.005337Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:ccfee7e5a930b6fb73945b07d18f0b1dd9d3cded4872f64e72891246d039fc88","observation_id":"5c36a4d7-0de0-47d1-8af0-179aa8c5939c","resolution":{"observed_at":"2026-08-12T14:58:43.005337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.009885Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.009885Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:54d9ff1aab9fe0034b8807d21fd9cad5b2e2d1e888fc28987bef3e4f41b3b535","observation_id":"54b27ab6-d0a3-4c2e-8615-17d4a70fdf94","resolution":{"observed_at":"2026-08-12T14:58:43.009885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08730","last_updated":"2024-04-03T15:22:23Z","snapshot_observed_at":"2026-08-13T00:54:56.865985Z","submitted_at":"2024-03-13T17:29:45Z","title":"Strengthening Multimodal Large Language Model with Bootstrapped Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08730","snapshot_observed_at":"2026-08-12T14:58:43.014298Z","title":"Strengthening multi- modal large language model with bootstrapped preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.014298Z"},"links":{"cited_paper":"/paper/2403.08730","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:f402d36b4b6bcb0264b8205edc0e3e44d8ec059a2a8820e3895a21fa5e864246","observation_id":"0073ea85-db72-4aca-bd51-d7b67566ff5c","resolution":{"observed_at":"2026-08-12T14:58:43.014298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.477386Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"84f76c21-6682-4f12-92fa-a72ea9c06cad","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.018997Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:75d1baca8c444cbad166b0cd04ac58d5c919b1c8254b8448dd3680ff95b458b3","observation_id":"bc6b0de0-f74a-44f4-a4ec-85938236add7","resolution":{"observed_at":"2026-08-12T14:58:44.482432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.023292Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.023292Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:bc2056f36714d7fbb2275dfbc4603196e17bbdc9d61f75e361ae7c6641939253","observation_id":"b85c0898-0943-4897-8bac-4a5da5a97b5c","resolution":{"observed_at":"2026-08-12T14:58:43.023292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.449988Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":"f1e93933-e664-4547-b710-c1887207c1c3","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.061051Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:c11a067cf308e10e80ff5ce737035f1008e10aeced9ca54df8dd41ec19c759b2","observation_id":"c428b956-4f77-4182-9193-6431105f8112","resolution":{"observed_at":"2026-08-12T14:58:44.455332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T14:58:43.084563Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.084563Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:35a5ba7f8e021341638de251f75911a5c449ec5c3a60aabf187de718a32bb6f1","observation_id":"bacfa353-f4bd-4eb7-8b4c-ab861d80a813","resolution":{"observed_at":"2026-08-12T14:58:43.084563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.405409Z","title":"Towards vqa models that can read","venue":null,"work_id":"288878e2-2577-413a-bb29-86ffd77fb2de","year":2019},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.090981Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:e80fc32a150920a8eb6f323f4f60a852eddc232315c7d8cfdffb985e54ee4d64","observation_id":"e495b535-fcf1-4180-a3d4-a1768ff997bc","resolution":{"observed_at":"2026-08-12T14:58:44.438925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13733","last_updated":"2024-10-17T16:36:38Z","snapshot_observed_at":"2026-08-12T22:20:47.228816Z","submitted_at":"2024-10-17T16:36:38Z","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","version":1},"cited_work":{"arxiv_id":"2410.13733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13733","snapshot_observed_at":"2026-08-12T14:58:43.820840Z","title":"Improving Multi-modal Large Language Model through Boosting Vision Capabilities","venue":"cs.CV","work_id":"ee85e822-a5fb-4f02-b5d4-bea92b58c51f","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.096094Z"},"links":{"cited_paper":"/paper/2410.13733","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:dd683ac29b13a189a6db1889c3896077508a03d3c50db8896e3499d3b995efc0","observation_id":"9360bab2-3464-492d-95d0-f3c01d58014a","resolution":{"observed_at":"2026-08-12T14:58:43.881132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-12T14:58:43.100804Z","title":"Aligning large multi- modal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.100804Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:75fd01710324b8ad0f7ecda643cf439739b3fd974adcbab1b017862052759eb8","observation_id":"0628616f-3067-4613-8c82-ca2b18bf89e4","resolution":{"observed_at":"2026-08-12T14:58:43.100804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T14:58:43.106019Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.106019Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:6bba03d675a65dc399f77c960f10b14d12ce220ceee0bf5ffa6ebb7a3146515c","observation_id":"a0a32663-3ec7-471b-90af-7515e6269bf9","resolution":{"observed_at":"2026-08-12T14:58:43.106019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15973","last_updated":"2025-02-08T21:50:41Z","snapshot_observed_at":"2026-08-12T23:58:23.908585Z","submitted_at":"2024-05-24T23:09:27Z","title":"Enhancing Visual-Language Modality Alignment in Large Vision Language Models via Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15973","snapshot_observed_at":"2026-08-12T14:58:43.111187Z","title":"Enhancing visual- language modality alignment in large vision language mod- els via self-improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.111187Z"},"links":{"cited_paper":"/paper/2405.15973","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:e442e8d9e1db0b94ddb5afafe4d9c8541ebe73b30e25f1fd30846058ce8fa6fc","observation_id":"fda87008-9453-4592-8f8a-c60a3b90b76f","resolution":{"observed_at":"2026-08-12T14:58:43.111187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-08-13T05:05:26.619106Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-12T14:58:43.116549Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.116549Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:1a7b3f948b79d36ba16dddd29c3da06744928f5f3a64840b3a6364030246c889","observation_id":"85960aff-4a04-42e4-9bca-69303c6d15c0","resolution":{"observed_at":"2026-08-12T14:58:43.116549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.313707Z","title":"Finetuned language models are zero-shot learn- ers","venue":null,"work_id":"473b2814-0c1d-4f32-b1c7-a4643bfddc7d","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.121904Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:26ab59e617ea2385970690aaf9dd3f4835bbe1c93eb4111cdcaf5429b987481c","observation_id":"ba68516c-f71c-4423-bcd3-ffdb9bd47ce9","resolution":{"observed_at":"2026-08-12T14:58:44.360844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.127468Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.127468Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:4cd2dfe84ff67eb1cf4cfed6c0bec7023a2d3890ae119e5a11a45fff8262f6aa","observation_id":"e6e2386f-5a81-483e-8f08-7af1aca2430c","resolution":{"observed_at":"2026-08-12T14:58:43.127468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-13T15:48:44.505862Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-12T14:58:43.132410Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.132410Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:164949582318cdf1c9a885569eb51c24510fa05b21eed2bf39548f670d75b081","observation_id":"2d472179-5ac1-45cd-a058-aaaf1c45f832","resolution":{"observed_at":"2026-08-12T14:58:43.132410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.204113Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":null,"work_id":"14bb1ce4-e5fc-4ece-9e29-f8b3b4bc9fd7","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.137030Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:7765d2a08c486f0ed92f0b3db61913043a2a33119d30382eeeaf1f54e66c3da3","observation_id":"9c9d3f91-9754-4836-83aa-61b750e7b016","resolution":{"observed_at":"2026-08-12T14:58:44.258968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-12T14:58:43.142427Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.142427Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:f4f44ac57e19de8737229dfa2e63a0508186314c442ce79f869f766c16596d75","observation_id":"f9cbea60-90fa-4966-b69b-2fd59088d728","resolution":{"observed_at":"2026-08-12T14:58:43.142427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.187729Z","title":"Token-level direct prefer- ence optimization","venue":null,"work_id":"a0bb3ebb-3393-4520-841e-06577c4cce48","year":null},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.147270Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:588ebd1a1cd86f1eabe909e82ee7a473e13e122f8b72c2f97eb0f023e285756a","observation_id":"add161f7-45d0-4945-9a34-7804831dca39","resolution":{"observed_at":"2026-08-12T14:58:44.192399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09474","last_updated":"2023-07-18T17:56:06Z","snapshot_observed_at":"2026-08-13T10:53:07.824758Z","submitted_at":"2023-07-18T17:56:06Z","title":"ChatSpot: Bootstrapping Multimodal LLMs via Precise Referring Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09474","snapshot_observed_at":"2026-08-12T14:58:43.151627Z","title":"Chatspot: Bootstrapping multimodal llms via precise referring instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.151627Z"},"links":{"cited_paper":"/paper/2307.09474","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:760a4f4e478566f720d981b5fcc0f45b657d2dd7334ede39deac0a2703a1a361","observation_id":"18c45ca8-5129-42e9-9460-eeec3061e06f","resolution":{"observed_at":"2026-08-12T14:58:43.151627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-12T14:58:43.156556Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.156556Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:518a945e52e9412754e53a1b16e33d8c3a5caf1757b3c138ed4bd69e55f323cf","observation_id":"ad2f2b85-ab4b-4fc2-8a3a-d7efb8b3cadf","resolution":{"observed_at":"2026-08-12T14:58:43.156556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.170478Z","title":"Lima: Less is more for alignment","venue":null,"work_id":"76bf2ab1-3179-41a9-b603-be6ad88fdfdd","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.204931Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:b8b2e47d022019dc64f103f6649b84e36142ee740905bf541a19ef522299e006","observation_id":"117b7452-cfa3-4742-9915-59877dfd51ff","resolution":{"observed_at":"2026-08-12T14:58:44.177098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14622","last_updated":"2024-11-02T02:51:51Z","snapshot_observed_at":"2026-08-13T02:44:39.936004Z","submitted_at":"2024-05-23T14:30:33Z","title":"Calibrated Self-Rewarding Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14622","snapshot_observed_at":"2026-08-12T14:58:43.287932Z","title":"Calibrated self-rewarding vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.287932Z"},"links":{"cited_paper":"/paper/2405.14622","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:7306210809f85dfcadd0a614a7413ce98d1f67a160a87ca86c04dfbfbc30cde1","observation_id":"e6314292-d25f-44ef-ba1e-b1b1035789f1","resolution":{"observed_at":"2026-08-12T14:58:43.287932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:58:43.351600Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.351600Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:b8849a5b42cecb930d91d0844b93966d2ac8b57a9e2339d7d856e0aacc89cc4d","observation_id":"32679ab4-f065-4208-9c03-054790116fd6","resolution":{"observed_at":"2026-08-12T14:58:43.351600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.155180Z","title":"Multi-label self- supervised learning with scene images","venue":null,"work_id":"9e94a283-06d4-4380-b2a7-70651c2c9261","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.404328Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:96696f563c4034478bf3fabed7fcbf8db6d61919c25dda113aaafae50de2f25d","observation_id":"36e81391-2f15-4795-b1f8-4a5ccb92b691","resolution":{"observed_at":"2026-08-12T14:58:44.159954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.138371Z","title":"Quantized feature distillation for network quantization","venue":null,"work_id":"dab6bac8-c165-4e87-8a91-bcdfc2cc5d47","year":2023},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.409800Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:b9fb6cbe3b3e458ba8510d992a3e56a0f09032820671bf0db61e6ad353b83d63","observation_id":"3e34811d-7d7c-42f2-9bb1-df6772bee8f3","resolution":{"observed_at":"2026-08-12T14:58:44.143565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10501","last_updated":"2024-08-21T11:36:47Z","snapshot_observed_at":"2026-08-13T00:29:10.116510Z","submitted_at":"2024-04-16T12:19:54Z","title":"Self-Supervised Visual Preference Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10501","snapshot_observed_at":"2026-08-12T14:58:43.414905Z","title":"Self- supervised visual preference alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.414905Z"},"links":{"cited_paper":"/paper/2404.10501","citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:527858bbbc0e3630e0bad14ba6a079a6dc34a8474f0736331a3378793fba6ea4","observation_id":"d8ef4bab-6bf2-4feb-ac9e-bff7cffd3016","resolution":{"observed_at":"2026-08-12T14:58:43.414905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:44.122577Z","title":"Llava-phi: Efficient multi-modal assistant with small language model","venue":null,"work_id":"5ae3892b-69c1-468c-856c-32392a8adf02","year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.420092Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:67208d1e93e2dc160a0a36c55807583cd75c3b7e3dc0335a537f4ebfb3010632","observation_id":"44b228c8-8180-46e1-9277-8d27eca911cc","resolution":{"observed_at":"2026-08-12T14:58:44.127762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:58:43.424797Z","title":"Multi: Multimodal understanding leaderboard with text and images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:58:43.424797Z"},"links":{"citing_paper":"/paper/2411.14797"},"observation_digest":"sha256:17b876ffe634dca15cf65b04aa32826471778403809f4ecfaf0d1600697a82ac","observation_id":"52625be0-87db-4cb8-a6ca-fd175383b8a7","resolution":{"observed_at":"2026-08-12T14:58:43.424797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14797","last_updated":"2024-11-22T08:48:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T14:50:27.319819Z","submitted_at":"2024-11-22T08:48:30Z","title":"Continual SFT Matches Multimodal RLHF with Negative Supervision"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":16},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2411.14797."}