{"as_of":"2026-08-20T03:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7c3d7a707cb26db5dc3fa6ec66ad87a660016a96b9fe5be9e19237aca7ba9e1","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:19:23.747780Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.11132/citation-record","integrity":"/paper/2511.11132/integrity","json":"/paper/2511.11132/citation-record.json","paper":"/paper/2511.11132"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T22:19:23.606034Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.606034Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:6e35567e4485a6e0e199eb0fd027de93660a7c6e4a367f412bd2d5fb6b80d7ea","observation_id":"a856b324-4683-4d5e-9843-4e182f86be27","resolution":{"observed_at":"2026-08-03T22:19:23.606034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.609794Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.609794Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:3000ce904ce93189d155690bcf9abab99945f0b66cb584140d584c6ad4ae53f4","observation_id":"227add3b-52ae-4645-aa06-269248604787","resolution":{"observed_at":"2026-08-03T22:19:23.609794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.612460Z","title":"Language models are few-shot learners.Ad- vances in neural information processing systems, 33: 1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.612460Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:fcf4f44a87966ed839fba77361e5eb3809f0ed5736d8b47c55c5348d27637a34","observation_id":"547ca472-ad31-4046-bc5e-58f3feda5d1c","resolution":{"observed_at":"2026-08-03T22:19:23.612460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.615419Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.615419Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:52d9032786f18485718abd9252eda3e841af7e9ba1599dbe501b0cdc67c1efc9","observation_id":"9242f7d9-d782-40bc-ae45-a27ac7e217dd","resolution":{"observed_at":"2026-08-03T22:19:23.615419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.618116Z","title":"Visual chain-of-thought prompting for knowledge-based visual reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.618116Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:4ee8a43717c669bd5d903b59bcd0014a6b6bfc9738d23a91e716f421d8d80d01","observation_id":"dfcb3628-6e02-4475-b144-f55591c1ffcf","resolution":{"observed_at":"2026-08-03T22:19:23.618116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.620875Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.620875Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:0cf657c806253d982df4a35a108a0e8f5ae5a67c3539203d51631025aaf81aea","observation_id":"5c7f1a76-4f80-4863-8bd2-c618a09b0a13","resolution":{"observed_at":"2026-08-03T22:19:23.620875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.623585Z","title":"Modality-aware inte- gration with large language models for knowledge-based visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.623585Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:afad32341b35306c6f6b392eeefa495666f03cbba7982f651e06c0d07e043442","observation_id":"db3fc461-537c-498a-acff-34ba500c89a8","resolution":{"observed_at":"2026-08-03T22:19:23.623585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.626094Z","title":"Palm- e: an embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.626094Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:638074b571284653f8a8c616c2b0afb8f5ad4bceee13a9423198f756ffea7528","observation_id":"851e53b5-6c37-4181-8f23-4eabc711f5d4","resolution":{"observed_at":"2026-08-03T22:19:23.626094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.628459Z","title":"Notes-guided mllm reasoning: Enhancing mllm with knowledge and visual notes for visual question answer- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.628459Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:af6c5f50ec3ee22698e2b0aa107a758df1cc7beb73261b21690fe5a475daf7f5","observation_id":"3ef7546d-b697-46ed-a217-22228008c84b","resolution":{"observed_at":"2026-08-03T22:19:23.628459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.631029Z","title":"Transform- retrieve-generate: Natural language-centric outside- knowledge visual question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.631029Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:2b356d1af308329c60abb3c5a48782bb43b74398532e086b9e2077885417238c","observation_id":"37d8b575-8a65-4557-9c68-70fd53bff3ed","resolution":{"observed_at":"2026-08-03T22:19:23.631029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.633380Z","title":"Conceptbert: Concept-aware repre- sentation for visual question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.633380Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:dd1227c054fca3c312ae73179811641e1af10c5c8cccf7491a5f83da0b50369c","observation_id":"a35ae7b4-30d6-44de-a34b-a794cd3d1738","resolution":{"observed_at":"2026-08-03T22:19:23.633380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.636063Z","title":"Making the v in vqa matter: El- evating the role of image understanding in visual ques- tion answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.636063Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:15d4bde604b4e16f107d89ed4f74e4a85290c2ececf4a4764eea6e7ae645738e","observation_id":"48f56383-a8dc-4b70-b5a0-125291d604e3","resolution":{"observed_at":"2026-08-03T22:19:23.636063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.638995Z","title":"Kat: A knowledge augmented transformer for vision- and-language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.638995Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:f6d7a52a38591856e15441ee9c16e991a3dbf145f07b76dea3dfb4e77fa2b968","observation_id":"5ac3b9e1-add2-4e5a-beaf-a7f7b924d524","resolution":{"observed_at":"2026-08-03T22:19:23.638995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T22:19:23.641255Z","title":"Deepseek-r1: Incentivizing reason- ing capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.641255Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:fa388a3c87758fbeccca9a88c49d77f68bd5b52d2411037b71da2bb809643b30","observation_id":"83e163d6-32fb-4829-bcb2-32eea89c21f5","resolution":{"observed_at":"2026-08-03T22:19:23.641255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.643965Z","title":"Self-bootstrapped visual-language model for knowledge selection and question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.643965Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:2ce11d4e4279348d67f57fa4b3a895fa5f808f1a8cafc7c94a88edad28b0bdd7","observation_id":"35ed5475-4d37-4e53-a8f7-a151c71c8b9a","resolution":{"observed_at":"2026-08-03T22:19:23.643965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.646448Z","title":"Lora: Low-rank adaptation of large language mod- els.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.646448Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:1d262c84aa620b839358ff038b241f2a57712a956239bc577aef19fdbf413506","observation_id":"dbe2bbd0-21ea-4b7a-a6ca-139717f55c9c","resolution":{"observed_at":"2026-08-03T22:19:23.646448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.648880Z","title":"Promptcap: Prompt- guided image captioning for vqa with gpt-3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.648880Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:fca12155e41a3b8710edd286d46c1c060b007a79fb622ac48ec29179e85da877","observation_id":"9caa5791-24bf-4107-af07-659e22d69095","resolution":{"observed_at":"2026-08-03T22:19:23.648880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.651239Z","title":"Reveal: Retrieval-augmented visual-language pre-training with multi-source multi- modal knowledge memory","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.651239Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:12e572e2d25a812f565e453c7cdd14ebdff9e99fc08c92dc3a4cf98ae35b5924","observation_id":"12eecd2d-3768-4b35-8df5-7c973a60d45a","resolution":{"observed_at":"2026-08-03T22:19:23.651239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T22:19:23.653592Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.653592Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:4cc939d973bcd1cc29e58971af51512c01a7cc2154d9517855f1397194a5a6ad","observation_id":"ad5821d8-3fb5-48c9-ad9b-a0742a2325f9","resolution":{"observed_at":"2026-08-03T22:19:23.653592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.656894Z","title":"Large language models know what is key visual entity: An llm-assisted multimodal retrieval for vqa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.656894Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:737811e8e7c8e6bb7057bd4028becd68af3e2f25d937d07c8a84dc2c165e5e9f","observation_id":"9a61fa14-bbae-480e-b46f-3da1f095e84e","resolution":{"observed_at":"2026-08-03T22:19:23.656894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07424","last_updated":"2025-07-10T04:31:56Z","snapshot_observed_at":"2026-08-19T02:04:29.338812Z","submitted_at":"2025-07-10T04:31:56Z","title":"Corvid: Improving Multimodal Large Language Models Towards Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07424","snapshot_observed_at":"2026-08-03T22:19:23.659385Z","title":"Corvid: Improving multimodal large lan- guage models towards chain-of-thought reasoning.arXiv preprint arXiv:2507.07424, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.659385Z"},"links":{"cited_paper":"/paper/2507.07424","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:98ae27d72cfe0936deb6e8f25e3818e486d565127d23792f340a6884c4060dc3","observation_id":"f3753ee6-1b4d-45b0-87f4-eaefeb704ece","resolution":{"observed_at":"2026-08-03T22:19:23.659385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.662100Z","title":"Mm-reasoner: A multi-modal knowledge-aware framework for knowledge-based vi- sual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.662100Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:a4c7da5472fa099d64dcf46d9acb22137946f72bab566541ab471e06f93ed3b6","observation_id":"5dd3ca80-db90-43b4-87f9-cf7e04c3f320","resolution":{"observed_at":"2026-08-03T22:19:23.662100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.664700Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.664700Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:1a434159408821332314666248fbcdc817877348d19342f0293b5ae735e900b6","observation_id":"7635c440-7d41-4a81-ac56-6ab48bb65c37","resolution":{"observed_at":"2026-08-03T22:19:23.664700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.667081Z","title":"Retrieval augmented vi- sual question answering with outside knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.667081Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:8a683eb8b2499aa87c68029c421ab265ee260f71121a5ef503e64e30ff658470","observation_id":"8cc4695a-19c3-44c2-81b6-1bc9af83b28c","resolution":{"observed_at":"2026-08-03T22:19:23.667081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.669495Z","title":"Fine-grained late-interaction multi-modal retrieval for retrieval augmented visual question answering.Advances in Neural Information Processing Systems, 36:22820–22840, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.669495Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:a5c7c427b047a3c4e2cdfb7f3a46e6b6f69d6f97b42572b25b83e531ead50717","observation_id":"690e57c2-48ba-4654-9b6d-53e9236c30d1","resolution":{"observed_at":"2026-08-03T22:19:23.669495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.672044Z","title":"Revive: Regional visual representation matters in knowledge-based visual ques- tion answering.Advances in neural information process- ing systems, 35:10560–10571, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.672044Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:836a457647efb9f45ad42062d8283015c37a106390c3b5d73d846e939e72a2dd","observation_id":"51f5f09e-2e30-4069-b3f3-9aa4441eee48","resolution":{"observed_at":"2026-08-03T22:19:23.672044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.674400Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.674400Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:a660b8e3f914c195c6d0e83163b6c15aab68207ac81324745852ecc3086904cd","observation_id":"8ffdc0d1-17d5-4b63-b8e3-e1cb93f8f5dd","resolution":{"observed_at":"2026-08-03T22:19:23.674400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.677005Z","title":"Retrieval-augmented visual question answering via built-in autoregressive search en- gines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.677005Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:760a464e04006b1acce0371c4400ca454206c0669c1e471035e4f35a98232ed6","observation_id":"4ed571bd-3ab5-4af4-ba6a-bd81708ef983","resolution":{"observed_at":"2026-08-03T22:19:23.677005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.679456Z","title":"Learn to explain: Multi- modal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.679456Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:85ce550025d72b2c6605ed3b5a94a68d1d7dc934da4ba77df49760dac269476c","observation_id":"00b2f48c-ffe6-4778-ae82-97bf14a5c4d1","resolution":{"observed_at":"2026-08-03T22:19:23.679456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04014","last_updated":"2021-09-09T03:21:32Z","snapshot_observed_at":"2026-08-18T06:11:55.887802Z","submitted_at":"2021-09-09T03:21:32Z","title":"Weakly-Supervised Visual-Retriever-Reader for Knowledge-based Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04014","snapshot_observed_at":"2026-08-03T22:19:23.681777Z","title":"Weakly-supervised visual-retriever-reader for knowledge-based question answering.arXiv preprint arXiv:2109.04014, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.681777Z"},"links":{"cited_paper":"/paper/2109.04014","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:f6f79792c93472ece3a6b03f257a170cff571bfdde68b10b5e748465ea6b763c","observation_id":"813129b5-89a7-420f-8a7f-f040fe200413","resolution":{"observed_at":"2026-08-03T22:19:23.681777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.684489Z","title":"Ok-vqa: A visual question answer- ing benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.684489Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:6c2aa2afaf413679af7f5050d1a97fb9571c90b758800f9525d53f8cd2d6ca8e","observation_id":"a6ce6931-e1f8-44a2-abb8-7588a3dd4c43","resolution":{"observed_at":"2026-08-03T22:19:23.684489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.687208Z","title":"Krisp: Integrating implicit and symbolic knowledge for open-domain knowledge- based vqa","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.687208Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:e76e2dc1ee6c73e50c30a8175bc5856a792fb648bb928a9c879b887fa9bb9676","observation_id":"769dc80e-ba55-4076-ace4-322d05e9bf0a","resolution":{"observed_at":"2026-08-03T22:19:23.687208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.689584Z","title":"Di- rect preference optimization: Your language model is se- cretly a reward model.Advances in neural information processing systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.689584Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:0a6ac223003071ce25d535bfbc769362927e24e48d51f4e944dcabbedc6641b0","observation_id":"7c70e120-0abd-429f-95ae-c5a3f957b8a9","resolution":{"observed_at":"2026-08-03T22:19:23.689584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.692166Z","title":"Exploring the limits of transfer learn- ing with a unified text-to-text transformer.Journal of machine learning research, 21(140):1–67, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.692166Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:1bb491c5f1006e4ea91df51c2a62a82f1c7f2e8c106f3786f7fafb4c43426585","observation_id":"041e7afd-6bcb-4c1c-91c4-a1d122e06db8","resolution":{"observed_at":"2026-08-03T22:19:23.692166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.694549Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.694549Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:ff212dc724e8a1e805bf732d855671a5cbf799a0b204a54ed7864c97102d76f1","observation_id":"f8d29a0c-60db-4759-b417-93761f76d9de","resolution":{"observed_at":"2026-08-03T22:19:23.694549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.697023Z","title":"Kvqa: Knowledge-aware visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.697023Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:ba823865ffe12eaa5fa2f3be5a660a83755d8291de97cae8100176899ddf23ea","observation_id":"b89791c4-7440-4812-ab40-637960aad89a","resolution":{"observed_at":"2026-08-03T22:19:23.697023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.699429Z","title":"Combo of thinking and observing for outside-knowledge vqa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.699429Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:3a5d76a3f14bc7fa4113b271f49885f94f3e8adc97eabc1c464497f07b073886","observation_id":"322664d1-7dde-461f-83d8-d8d48852593f","resolution":{"observed_at":"2026-08-03T22:19:23.699429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.701875Z","title":"Con- ceptnet 5.5: An open multilingual graph of general knowledge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.701875Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:a81569f172cec18f5f149c048d728561c4bdda763b7a583631b62ee54e5a73a3","observation_id":"9f39e50e-0f05-427e-bc3d-9cdbebc1ce5b","resolution":{"observed_at":"2026-08-03T22:19:23.701875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-03T22:19:23.704847Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.704847Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:fded8b8acd58abea463e343867c693c5d01076875feb89def98734f18707adce","observation_id":"56ee9190-8c44-4df8-94e2-addd95ed7f39","resolution":{"observed_at":"2026-08-03T22:19:23.704847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T22:19:23.707483Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.707483Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:9f5fc3beea4754e56e76aa63f588e22d435a90b1a56ea5b9d10aa4e08b70cf36","observation_id":"ff3b9531-7457-4ae3-b450-cd21c9fe9761","resolution":{"observed_at":"2026-08-03T22:19:23.707483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.710273Z","title":"Wikidata: a free collaborative knowledgebase.Communications of the ACM, 57(10):78–85, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.710273Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:27e01a36350a10fbeb667724bfb36244f4c4e1f7947fc821c714e11c42902905","observation_id":"a6e6ee8a-077f-4f88-999d-fd97c15f70b4","resolution":{"observed_at":"2026-08-03T22:19:23.710273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.712845Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.712845Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:1418ebf45e6ddc0135b5c05d35be11873d1414fa7ae0118c9ad0ddb5c37bdf72","observation_id":"145233f2-0720-426c-bc44-df95146683b7","resolution":{"observed_at":"2026-08-03T22:19:23.712845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-03T22:19:23.715771Z","title":"Mul- timodal chain-of-thought reasoning: A comprehensive survey.arXiv preprint arXiv:2503.12605, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.715771Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:7195697d95872e4a65eb56fa8bf4d71adc221dbf972ac9ab950fea224eea2896","observation_id":"4cb52080-0d2a-45dd-8fa3-e730e3cdc1d5","resolution":{"observed_at":"2026-08-03T22:19:23.715771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.719145Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.719145Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:536aec78689d81398dafe7c8850190b7bed1392836d8499aa922656bfffc527a","observation_id":"ad9dc4fd-1da1-4c58-af14-5beea75d2952","resolution":{"observed_at":"2026-08-03T22:19:23.719145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.721873Z","title":"Multi-modal answer validation for 10 knowledge-based vqa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.721873Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:7864bdcda79ec5d7289120c4f50e26d24243b89e435673a82ed6955d8caf10b0","observation_id":"2a08dd01-b34f-4b8d-8ecc-3fe9ffe5b41a","resolution":{"observed_at":"2026-08-03T22:19:23.721873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.724561Z","title":"A simple baseline for knowledge-based visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.724561Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:a67477c2dbbab2c8c9f90b15e1e4e006846f7e7f8ec66ffc514043a3f7913ab6","observation_id":"8c26d032-93ec-475b-a1df-e3ebfb02ae9b","resolution":{"observed_at":"2026-08-03T22:19:23.724561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-03T22:19:23.726993Z","title":"Llava-cot: Let vision language models reason step-by-step.arXiv preprint arXiv:2411.10440,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.726993Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:cdcaf2061eb2adc7ecab563d63812961bd25190a47d3dd054d86da44b7ce2f46","observation_id":"73116afd-17a4-49a4-9f54-b44cc68ba87b","resolution":{"observed_at":"2026-08-03T22:19:23.726993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.729946Z","title":"An empiri- cal study of gpt-3 for few-shot knowledge-based vqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.729946Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:dcf2872196aaf9b61664fca46d6bb4ef244326fac69ed390ac529270fb5a86e7","observation_id":"8f55d160-3c1b-46b0-a9e8-fbc87975a726","resolution":{"observed_at":"2026-08-03T22:19:23.729946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.732233Z","title":"Self-distillation bridges distribution gap in language model fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.732233Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:7376a390f40ae52693c891ef96750e5e5a86bd5fd1f6b84c3c494edd7c20e102","observation_id":"fadb3203-afb5-497a-a537-5c86cd9dfe51","resolution":{"observed_at":"2026-08-03T22:19:23.732233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.734875Z","title":"Separation of powers: On segregating knowledge from observation in llm-enabled knowledge-based visual question answer- ing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.734875Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:b236a048f8570bdaa97a495c21ffd501da2a00597d4fec6d82413cf542f68cd1","observation_id":"ed6b582c-2a18-4cb5-b71f-3be7a585242f","resolution":{"observed_at":"2026-08-03T22:19:23.734875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18319","last_updated":"2024-12-31T07:41:30Z","snapshot_observed_at":"2026-08-15T19:40:30.225099Z","submitted_at":"2024-12-24T10:07:51Z","title":"Mulberry: Empowering MLLM with o1-like Reasoning and Reflection via Collective Monte Carlo Tree Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18319","snapshot_observed_at":"2026-08-03T22:19:23.737176Z","title":"Mulberry: Empow- ering mllm with o1-like reasoning and reflection via collective monte carlo tree search.arXiv preprint arXiv:2412.18319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.737176Z"},"links":{"cited_paper":"/paper/2412.18319","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:2b6696a2758ddf4da097a82249035632ef1a3da879d6ac84865bf3d942ee57b9","observation_id":"eeae1f07-b5ad-4c89-b6b7-b8cbdaed8421","resolution":{"observed_at":"2026-08-03T22:19:23.737176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.740022Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.740022Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:76c1952a6a407efe0fd60f1008bd42c31c773d23c951bc723919cb765c1a7f02","observation_id":"a9bec82e-cbe2-4bce-8805-ce3bb1573123","resolution":{"observed_at":"2026-08-03T22:19:23.740022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.742598Z","title":"Multimodal chain-of- thought reasoning in language models.Transactions on Machine Learning Research, 2024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.742598Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:0349f35bf407ebd2b1e63aad20767d6cfa7923024f04a8996417cb8cb96b6114","observation_id":"13785fc6-55f9-4cca-9b4e-7c0cd89b346f","resolution":{"observed_at":"2026-08-03T22:19:23.742598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:19:23.745060Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.745060Z"},"links":{"citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:489d80ac23ebac8bf4a5be97e1fade617309f2ff438fd507ecf38c7a60a73335","observation_id":"e63c6a68-977e-47d5-94c6-457b39669f4b","resolution":{"observed_at":"2026-08-03T22:19:23.745060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-03T22:19:23.747780Z","title":"Chosen” and “Rejected","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T22:19:23.747780Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2511.11132"},"observation_digest":"sha256:2c663f2c571be0401e00a540e6ee0684ed70d0b7800662c918061f02f83a582c","observation_id":"df7c650e-4a66-46c0-8f96-93067bd9c579","resolution":{"observed_at":"2026-08-03T22:19:23.747780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.11132","last_updated":"2026-07-14T03:06:56Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T09:24:34.444419Z","submitted_at":"2025-11-14T10:03:23Z","title":"From Hindsight to Foresight: Self-Encouraged Hindsight Distillation for Knowledge-based Visual Question Answering"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2511.11132."}