{"as_of":"2026-08-13T06:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:41a84f4ca3e2db3d66d6de62ebeb8717dc36391c99d0a52492c7845e1bf01e9e","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:56:11.028503Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:28:45.967569Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13053","snapshot_observed_at":"2026-08-03T06:28:45.967569Z","title":"Megl: Multimodal explanation-guided learning.arXiv preprint arXiv:2411.13053,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07008","last_updated":"2026-07-20T11:10:30Z","snapshot_observed_at":"2026-08-03T23:15:33.062867Z","submitted_at":"2026-01-30T10:29:27Z","title":"Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:28:45.967569Z"},"links":{"cited_paper":"/paper/2411.13053","citing_paper":"/paper/2602.07008"},"observation_digest":"sha256:2ad4e18e12a10544200ed62e7c5044d11c47ff1ac08949ef4131149ce6e1f5b3","observation_id":"59674582-494d-4957-a588-f117f2b3c38e","resolution":{"observed_at":"2026-08-03T06:28:45.967569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13053/citation-record","integrity":"/paper/2411.13053/integrity","json":"/paper/2411.13053/citation-record.json","paper":"/paper/2411.13053"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:56:10.660284Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.660284Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:42b923c71c75e0ada00ea6e049ddda4a61d77162718be5d37c6536c4222a0ad5","observation_id":"15353b77-9544-449e-a4cb-8f1c24276c75","resolution":{"observed_at":"2026-08-12T16:56:10.660284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.277244Z","title":"Tbexplain: A text-based explanation method for scene classification models with the statistical prediction correction","venue":null,"work_id":"1607635b-0979-4ae3-94e2-6d6133a2325a","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.666878Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:91f595e26c3f508e4b5dd223013beabf7cd2953d26bc545fae3ebf48910e468e","observation_id":"7bc41f5c-d495-4dd5-b73c-28586f8d5158","resolution":{"observed_at":"2026-08-12T16:56:12.283009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.672926Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.672926Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d804a8c00b9f15b016f4ccb32ea05e747e69fba029c706667c248084dcc3505a","observation_id":"c2879fd1-ee4f-4a37-9ce1-23997739be21","resolution":{"observed_at":"2026-08-12T16:56:10.672926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T16:56:10.678779Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.678779Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:39f11090b03ed02f3d6fc7a0900b6f2d7385f69f532254a33e7b10248d6038ee","observation_id":"85ae0cc5-ccd5-4c48-8a86-e94b200db6ec","resolution":{"observed_at":"2026-08-12T16:56:10.678779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.245933Z","title":"Explainable artificial intelligence (xai): Concepts, taxonomies, opportunities and challenges toward responsible ai","venue":null,"work_id":"cf3aeae6-acb8-4417-ba26-3948321a97f1","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.684903Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9f106bcc3cdf6c444898221070c25f680aac16f5af8d796acce0de816e6fc7da","observation_id":"7cbe616d-b9f4-492e-8ad3-60cf4d072cb0","resolution":{"observed_at":"2026-08-12T16:56:12.251668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.690613Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.690613Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:36c95f07ade2eb69eaba3f7c83190026f7afbc7243d03e588653c60170feef77","observation_id":"899117b8-c0e6-4a98-bbd2-124306b764f5","resolution":{"observed_at":"2026-08-12T16:56:10.690613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.696412Z","title":"Let there be a clock on the beach: Reducing object halluci- nation in image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.696412Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:10e63af34d0e74980ab246ba42cc543b8858b6f3c2e681a6aa784984ec02902d","observation_id":"c13859aa-b564-466c-bdb5-1a309aa9c406","resolution":{"observed_at":"2026-08-12T16:56:10.696412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.198893Z","title":"A survey on xai and nat- ural language explanations","venue":null,"work_id":"25b69b51-fd72-46ea-b779-470dd57e6f02","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.702334Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c292f799f1fdf8367c05c683c638b25018e901f52a562fad56bbfc958f171239","observation_id":"47983ac8-7e1d-4da0-8261-7d561c1babbe","resolution":{"observed_at":"2026-08-12T16:56:12.205236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.181675Z","title":"Machine learning interpretability: A survey on methods and metrics","venue":null,"work_id":"c44afa7b-4b41-4eb6-987c-e5ecf86c22ec","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.708048Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b963b0b71f2511419fed59cba300170611c8068d2516d108aa20690fe9271d9d","observation_id":"146450f3-937b-4809-8650-eb4620a0957f","resolution":{"observed_at":"2026-08-12T16:56:12.187087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T16:56:10.714945Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.714945Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:db3aebb00638853cfdd9872f496a4d5b9fc3432a4db92579cce90a88ee9e59c2","observation_id":"037c5f3f-1d90-41af-b474-af404cbb615f","resolution":{"observed_at":"2026-08-12T16:56:10.714945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.153909Z","title":"Techniques for in- terpretable machine learning","venue":null,"work_id":"2cae9d71-606a-4b91-a8a1-77b341fd2af8","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.721914Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:bd8608359fc3f6f6ccb74d112921237ca4c105cbc0014e7cc5c3c1b4ace429ed","observation_id":"81534ad3-e0c2-4a00-96fd-896ba1c66cc3","resolution":{"observed_at":"2026-08-12T16:56:12.162112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.130099Z","title":"Learn- ing credible deep neural networks with rationale regulariza- tion","venue":null,"work_id":"d0f55371-9bb1-4eca-b846-e55ff01838b9","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.727380Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:4dcfa4e0b762afefaaf45f0c0d6635028dc3cced27b90d1a2d04f827233cd168","observation_id":"5c894918-599e-46b5-b109-6de32f0c9d50","resolution":{"observed_at":"2026-08-12T16:56:12.137278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.107559Z","title":"Attention branch network: Learning of attention mechanism for visual explanation","venue":null,"work_id":"09008c72-0783-49bc-8615-c3652f95ba1b","year":2019},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.734558Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:866fb7e04742b91f6b06df11a61726b332c2337a5d8b88dc0c5ddd2b9ad5587c","observation_id":"2b78c56b-0dac-48a6-897f-7cd57aa8e746","resolution":{"observed_at":"2026-08-12T16:56:12.113801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.086612Z","title":"Res: A robust framework for guiding visual explanation","venue":null,"work_id":"80ce47dd-18fd-4cb3-89ad-958f7c5ea11d","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.742038Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:86c3fb324911e0becf3cd7e3e1a9a9d56da836c22e21fbc663a541096c30e0a0","observation_id":"56e56819-2781-4067-adbc-30e54b80ca64","resolution":{"observed_at":"2026-08-12T16:56:12.092452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.062457Z","title":"Going beyond xai: A system- atic survey for explanation-guided learning","venue":null,"work_id":"da17658e-8d8d-49e5-ba97-75b15e5ce7c6","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.748124Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c10753ca6fb83f19cdb03714288399fc07fc48c0575488d660c4736d3b0e3a61","observation_id":"1dcb86e1-9f93-434b-8216-1e828afeccba","resolution":{"observed_at":"2026-08-12T16:56:12.069196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04719","last_updated":"2024-06-06T18:05:40Z","snapshot_observed_at":"2026-08-12T23:51:39.530528Z","submitted_at":"2023-06-07T18:31:39Z","title":"Don't trust your eyes: on the (un)reliability of feature visualizations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04719","snapshot_observed_at":"2026-08-12T16:56:10.753790Z","title":"Don’t trust your eyes: on the (un) reliability of feature visualizations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.753790Z"},"links":{"cited_paper":"/paper/2306.04719","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:163ed61cabbdb8007a54a0c5fc57abb6ef3ea7ca86e36d8f5ddd7654a1e22866","observation_id":"98b98a3c-287c-483d-b648-635f1c4001c6","resolution":{"observed_at":"2026-08-12T16:56:10.753790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.039152Z","title":"Essa: Explanation iterative supervision via saliency-guided data augmentation","venue":null,"work_id":"b611a0b7-c1d1-49ff-a404-5c46d93a66bf","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.759684Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b427254eaf841e8dee789fbe3c92a1256a6ce5951bf24486f4e293b1bfddfec2","observation_id":"2adce892-e148-4d9e-8697-cc188f5c7927","resolution":{"observed_at":"2026-08-12T16:56:12.047347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00189","last_updated":"2023-10-31T23:24:22Z","snapshot_observed_at":"2026-08-13T05:35:20.435753Z","submitted_at":"2023-10-31T23:24:22Z","title":"XAI-CLASS: Explanation-Enhanced Text Classification with Extremely Weak Supervision","version":1},"cited_work":{"arxiv_id":"2311.00189","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.00189","snapshot_observed_at":"2026-08-12T16:56:11.461258Z","title":"XAI-CLASS: Explanation-Enhanced Text Classification with Extremely Weak Supervision","venue":"cs.CL","work_id":"118cb384-ba10-4e41-a840-8947a9628c9d","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.765942Z"},"links":{"cited_paper":"/paper/2311.00189","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:2780432d36166cd63e7be6da57505ef8c3c5e1034afc61aadad8baf43d2a535a","observation_id":"59d4c10b-5fa6-4c89-8878-19e29c5c76f5","resolution":{"observed_at":"2026-08-12T16:56:11.467685Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03961","last_updated":"2024-09-06T00:59:10Z","snapshot_observed_at":"2026-08-12T23:50:47.726454Z","submitted_at":"2024-09-06T00:59:10Z","title":"Generating Faithful and Salient Text from Multimodal Data","version":1},"cited_work":{"arxiv_id":"2409.03961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03961","snapshot_observed_at":"2026-08-12T16:56:11.433309Z","title":"Generating Faithful and Salient Text from Multimodal Data","venue":"cs.CV","work_id":"3d712da1-2080-4ab3-8219-37f9df3dbdd6","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.771646Z"},"links":{"cited_paper":"/paper/2409.03961","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:8ff07aac54e4dcdb88c488cb3915b972d428b94b835668024e7b60f47111067b","observation_id":"4a7d89d4-2ae6-44bd-b453-e73740ec871f","resolution":{"observed_at":"2026-08-12T16:56:11.439452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:12.016842Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"c86591f9-54f5-487d-8592-4b265266eb58","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.777520Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:4553065c882b425ee54903ec01360655fd7aa58bac6363a218506d5bb1a2e3c9","observation_id":"e8d0caaf-df93-42d4-82a6-ad7854bcfee4","resolution":{"observed_at":"2026-08-12T16:56:12.024021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.998199Z","title":"Generating vi- sual explanations","venue":null,"work_id":"d1829a81-7f88-49a0-abfa-3c83d0e6cdd9","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.783772Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c45b29e624046ab7fd5d6fac5e5864f9a565ac75719bce97177da757ae2eb014","observation_id":"602e1ae9-3e55-452f-9dc1-5b8b856d4ebf","resolution":{"observed_at":"2026-08-12T16:56:12.003327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T16:56:10.790044Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.790044Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:0ab869dca6d2e6daa276a92c202235de82a65e7805b51dbef8395cd1a72b500e","observation_id":"ebc38e85-ddbb-421a-9b7f-b89d83ba596a","resolution":{"observed_at":"2026-08-12T16:56:10.790044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10071","last_updated":"2023-06-13T10:55:29Z","snapshot_observed_at":"2026-08-12T23:51:40.745174Z","submitted_at":"2022-12-20T08:24:45Z","title":"Large Language Models Are Reasoning Teachers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10071","snapshot_observed_at":"2026-08-12T16:56:10.796057Z","title":"Large language models are reasoning teachers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.796057Z"},"links":{"cited_paper":"/paper/2212.10071","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:bb8491113fddf7cecf2b3a2ca292cec33bad56caccdca9a85c92c3a0ecfca89b","observation_id":"6f254c4a-8c19-4c69-94de-478503745cfa","resolution":{"observed_at":"2026-08-12T16:56:10.796057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T16:56:10.802153Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.802153Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9c23f6a2ba56f138a339d438f04bbbcb4be832c1263f074bca96a4cb0cea43c6","observation_id":"4040d0eb-80ed-45ee-9dec-41b38168d5b6","resolution":{"observed_at":"2026-08-12T16:56:10.802153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.980406Z","title":"Bliva: A simple multimodal llm for better handling of text-rich visual questions","venue":null,"work_id":"20df2e56-f427-46b7-be1a-3c71601b6da1","year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.808892Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b29f488ea62c0a7e0f024547706c32f00f63964129c4a5140ca9c28b76dd4773","observation_id":"a1f7f630-1207-4b51-856b-69c96ac39fa8","resolution":{"observed_at":"2026-08-12T16:56:11.985871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.815283Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.815283Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:15a7c09112e4a02b8d44c7239ccec6930d1877a3e072f14c9794aca6aabc5e94","observation_id":"3eae2815-0a6b-4f7d-a3dc-bdc6484c5a4d","resolution":{"observed_at":"2026-08-12T16:56:10.815283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.821291Z","title":"Hallucination augmented contrastive learn- ing for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.821291Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:793e5d69931b752e834598a31418335313e5f9f2d0425c6d37c546cf2036dfc4","observation_id":"3ed97673-8634-4388-83d0-6c2f2545e45b","resolution":{"observed_at":"2026-08-12T16:56:10.821291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.826822Z","title":"Deep learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.826822Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:70b443f404688a0527bec9da0a120d3c96e4af088ec13ea066b160b0d5b8994f","observation_id":"6a51ba39-de51-4193-b766-2d78bd219634","resolution":{"observed_at":"2026-08-12T16:56:10.826822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.834757Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.834757Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:e44570a92687d766191d7196e5672a58e0b31e99d0037008bf68c39dd7d1f61a","observation_id":"83afcede-b744-43ed-9f0e-210b7b8556ca","resolution":{"observed_at":"2026-08-12T16:56:10.834757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14050","last_updated":"2024-04-15T21:58:27Z","snapshot_observed_at":"2026-08-12T23:50:36.513758Z","submitted_at":"2023-06-24T20:15:07Z","title":"Symbolic Chain-of-Thought Distillation: Small Models Can Also \"Think\" Step-by-Step","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14050","snapshot_observed_at":"2026-08-12T16:56:10.840711Z","title":"Symbolic chain-of-thought distillation: Small models can also” think” step-by-step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.840711Z"},"links":{"cited_paper":"/paper/2306.14050","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:c5d8f349c295027a4071f84064c0062f10f92340b23ea710db816a1f77c48712","observation_id":"122bbb4a-7801-47f5-9096-3a3bda804545","resolution":{"observed_at":"2026-08-12T16:56:10.840711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.890868Z","title":"Vqa-e: Explaining, elaborating, and enhancing your answers for visual questions","venue":null,"work_id":"b94e0c51-6eb6-47d1-a23a-ce8cd953177c","year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.848190Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:cff329f74f19b3a518a4f26ce178219c60bc63b8d0fe0410f59028fb230b4055","observation_id":"df77f620-7aea-43c3-b353-2b6e26c8d8fb","resolution":{"observed_at":"2026-08-12T16:56:11.897684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06726","last_updated":"2022-10-13T04:50:02Z","snapshot_observed_at":"2026-07-06T14:04:32.971017Z","submitted_at":"2022-10-13T04:50:02Z","title":"Explanations from Large Language Models Make Small Reasoners Better","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.06726","snapshot_observed_at":"2026-08-12T16:56:10.853956Z","title":"Explanations from large language models make small reasoners better","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.853956Z"},"links":{"cited_paper":"/paper/2210.06726","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f290699726ba661d3728143118e4a49598120038fc2de693526723ff9865fbac","observation_id":"9e4357b6-e46c-4471-9d75-c0509a676a57","resolution":{"observed_at":"2026-08-12T16:56:10.853956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.859671Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.859671Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:84a3d33ff2a2feb4b4e78b85e574e7d3f8b0dd75dd2cdf9f98a6a1454ae0b77c","observation_id":"22fa143a-0efc-4d6e-bb66-03f38bea3a63","resolution":{"observed_at":"2026-08-12T16:56:10.859671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.865125Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.865125Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:09ca4e37ae75d12968587834220a9fbfefdceb41c5b8a7de118d772be0c1e1aa","observation_id":"76fc5d5c-7857-4505-be5f-ac1d1a78d020","resolution":{"observed_at":"2026-08-12T16:56:10.865125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07874","last_updated":"2017-11-25T03:53:32Z","snapshot_observed_at":"2026-07-06T05:43:42.722222Z","submitted_at":"2017-05-22T17:38:10Z","title":"A Unified Approach to Interpreting Model Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07874","snapshot_observed_at":"2026-08-12T16:56:10.870584Z","title":"A unified approach to interpreting model predictions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.870584Z"},"links":{"cited_paper":"/paper/1705.07874","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:aa8122eb405fa483fc4b9ad4f0a1516bf374a5f63c00b183f59c88a6534548aa","observation_id":"6052a327-dbc4-4348-9e1d-73070e0366ab","resolution":{"observed_at":"2026-08-12T16:56:10.870584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08410","last_updated":"2023-06-01T12:17:01Z","snapshot_observed_at":"2026-08-12T23:50:49.142907Z","submitted_at":"2022-12-16T11:24:42Z","title":"Teaching Small Language Models to Reason","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08410","snapshot_observed_at":"2026-08-12T16:56:10.876678Z","title":"Teach- ing small language models to reason","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.876678Z"},"links":{"cited_paper":"/paper/2212.08410","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d384a7a7a0a2b7ffdcaf69aec786b878e240789c6b22f4dc8b0d1d84740adb1a","observation_id":"56ec39f9-2eb3-41e4-a6e5-82335b3ca43f","resolution":{"observed_at":"2026-08-12T16:56:10.876678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.07526","last_updated":"2020-10-15T05:08:56Z","snapshot_observed_at":"2026-08-13T05:56:29.642305Z","submitted_at":"2020-10-15T05:08:56Z","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","version":1},"cited_work":{"arxiv_id":"2010.07526","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.07526","snapshot_observed_at":"2026-08-12T16:56:11.261608Z","title":"Natural Language Rationales with Full-Stack Visual Reasoning: From Pixels to Semantic Frames to Commonsense Graphs","venue":"cs.CL","work_id":"54c9620a-1a33-4f93-bc61-f74633c073cb","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.883474Z"},"links":{"cited_paper":"/paper/2010.07526","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:8f230c78f47a0e5694c3ff49ba8521cf46a345f8830c6dd85934699edb44ab4e","observation_id":"1e715a4a-d54c-47a3-bfcb-b2e6ff77c77d","resolution":{"observed_at":"2026-08-12T16:56:11.267610Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12808","last_updated":"2024-08-23T03:02:11Z","snapshot_observed_at":"2026-08-12T23:50:46.068821Z","submitted_at":"2024-08-23T03:02:11Z","title":"VALE: A Multimodal Visual and Language Explanation Framework for Image Classifiers using eXplainable AI and Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12808","snapshot_observed_at":"2026-08-12T16:56:10.890450Z","title":"Vale: A mul- timodal visual and language explanation framework for im- age classifiers using explainable ai and language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.890450Z"},"links":{"cited_paper":"/paper/2408.12808","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:de7e38d3129313cf354a0d159aa76cc668b11e735f33339b93948366df044cb5","observation_id":"c352a93d-f575-4683-8bf0-48133222af74","resolution":{"observed_at":"2026-08-12T16:56:10.890450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.896773Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.896773Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:127bfa720e8a8b61bca5675a94d246548f5a4d828f06c9d3a6bea3281aa29e16","observation_id":"30dbf13b-3c89-4e29-9d18-8e048b0419ca","resolution":{"observed_at":"2026-08-12T16:56:10.896773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.832934Z","title":"Multimodal explanations: Justifying deci- sions and pointing to the evidence","venue":null,"work_id":"6938e9b0-7adf-4c35-8991-e0baf66db7a3","year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.902344Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:2656f0af758ebe67cfdf6061e706214cf8c4be1a906fdd187ea774740ccfc384","observation_id":"13fe9371-f332-4959-a8b8-41f54d512a0b","resolution":{"observed_at":"2026-08-12T16:56:11.842324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.813416Z","title":"Ro- bust explanations for visual question answering","venue":null,"work_id":"f8a50420-5ccf-4f90-9239-9858b0028d25","year":2020},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.909821Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:7442e54a99d007cc0284644d2f142ef7818bcd59192a4d20fbd0051ce2a96643","observation_id":"c40bf59f-cab8-4229-a7bd-67ad88f0e56d","resolution":{"observed_at":"2026-08-12T16:56:11.819499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.07421","last_updated":"2018-09-25T18:16:18Z","snapshot_observed_at":"2026-08-10T19:32:03.798711Z","submitted_at":"2018-06-19T18:41:30Z","title":"RISE: Randomized Input Sampling for Explanation of Black-box Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.07421","snapshot_observed_at":"2026-08-12T16:56:10.916178Z","title":"Rise: Randomized input sampling for explana- tion of black-box models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.916178Z"},"links":{"cited_paper":"/paper/1806.07421","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d3f6c26433a10fc174a719b67a1a0645898088a638d61f020bd31119a4adc3d4","observation_id":"95c2a448-9cdd-4635-a578-3b026d7ae609","resolution":{"observed_at":"2026-08-12T16:56:10.916178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.922390Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.922390Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:9434621a6c1ea647b4786804be7427cab420bb21b1a2ee5171d60af72d450dc5","observation_id":"fc169658-621c-4730-a695-2163b296de94","resolution":{"observed_at":"2026-08-12T16:56:10.922390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02626","last_updated":"2021-04-29T00:36:17Z","snapshot_observed_at":"2026-08-12T23:50:50.242624Z","submitted_at":"2021-04-29T00:36:17Z","title":"A First Look: Towards Explainable TextVQA Models via Visual and Textual Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02626","snapshot_observed_at":"2026-08-12T16:56:10.927640Z","title":"A first look: Towards explainable textvqa models via visual and textual explanations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.927640Z"},"links":{"cited_paper":"/paper/2105.02626","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f1f1a95d53d025d512fd12cfd86c14f592478e4fa68ed13d9f86f98041cfc379","observation_id":"b20adb0b-4d6c-44ad-aa25-2dea72338326","resolution":{"observed_at":"2026-08-12T16:56:10.927640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.778479Z","title":"Interpretations are useful: penalizing explanations to align neural networks with prior knowledge","venue":null,"work_id":"95d3d72b-2c9a-4864-bc2b-7fb17fbd3b50","year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.934197Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:19b19100eb5cfe5cec2d90af3f680137a3099d6d07ed61b489a08fb62e97d4ce","observation_id":"a2f4a05d-5fc4-444a-8401-7d5effe0365a","resolution":{"observed_at":"2026-08-12T16:56:11.784062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.07450","last_updated":"2017-01-25T16:33:29Z","snapshot_observed_at":"2026-08-07T01:29:08.076157Z","submitted_at":"2016-11-22T18:34:36Z","title":"Grad-CAM: Why did you say that?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.07450","snapshot_observed_at":"2026-08-12T16:56:10.939679Z","title":"Grad-cam: Why did you say that? arXiv preprint arXiv:1611.07450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.939679Z"},"links":{"cited_paper":"/paper/1611.07450","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:966c4baa4c6867becfc91ca62d585400b7a1827e29beaf2079537942c78d3afd","observation_id":"4e6b52c1-2b6f-4c3d-81fb-1679a94ef007","resolution":{"observed_at":"2026-08-12T16:56:10.939679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.755854Z","title":"10 Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"26056930-abac-4a00-b1a8-218c35372701","year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.945055Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:65525f5dc14f9c4dd59ade02fdcb48ade5b9aa9c6f4164a29dbc9018eb94bb57","observation_id":"26b83f98-3f27-4dd7-a827-dc7ff3e54edd","resolution":{"observed_at":"2026-08-12T16:56:11.764337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.730703Z","title":"Human-ai interactive and continuous sensemaking: A case study of image classification using scribble attention maps","venue":null,"work_id":"d12a7df3-e018-4b21-ad38-f98fc2a92c41","year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.950683Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:b53211bdf338dfdd2be7ad6f4789372dd7769672249ca4855c262c1367fc3d82","observation_id":"0a306b1d-06ae-4e15-9e91-67bf3d10a69c","resolution":{"observed_at":"2026-08-12T16:56:11.738853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.706957Z","title":"A review of taxonomies of explainable ar- tificial intelligence (xai) methods","venue":null,"work_id":"bf494bd4-73e4-4600-99ac-f4f30b26126d","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.955766Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f8dce70eb8f289615f7145c441ffea4e513bbce7527cb5a81757d34614460f22","observation_id":"ea4f856a-b39e-4fa9-8f67-64adee87dcbd","resolution":{"observed_at":"2026-08-12T16:56:11.715500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.961575Z","title":"Axiomatic attribution for deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.961575Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:1cdf8667285e9e2a436f6509a0863a1c3f33d8d42fc04a2a43db4aad3de4666d","observation_id":"47b93eac-a449-49e2-86ea-6d7f6c393203","resolution":{"observed_at":"2026-08-12T16:56:10.961575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-08-12T23:53:39.680490Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-12T16:56:10.967542Z","title":"Robustness may be at odds with accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.967542Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d00c46e3fa8d15a8dfd7e365ac39fbd1682d9798be17ad50439d724e9a18585c","observation_id":"5d3324e8-4fbf-4783-9765-740e1caff284","resolution":{"observed_at":"2026-08-12T16:56:10.967542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.669257Z","title":"Explainable artificial intel- ligence (xai) in deep learning-based medical image analysis","venue":null,"work_id":"d6c2bdaa-4838-4d6f-97e0-9766b69cf4d8","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.973194Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:40ebf9aaedcc62250768f3d2935090d4dc4dbd9ea4b39cc87383bfbe8b866e23","observation_id":"4f7ba613-df0a-45b4-b7a7-b434be152d0b","resolution":{"observed_at":"2026-08-12T16:56:11.676349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:10.978628Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.978628Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:1aaa5faef13103ff873a862c347f232f0f6912291ef91575efa2a2d5a6f8e21e","observation_id":"e5034e88-8d5f-4f70-abd9-e7aa8747268a","resolution":{"observed_at":"2026-08-12T16:56:10.978628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02805","last_updated":"2019-06-03T19:54:15Z","snapshot_observed_at":"2026-08-12T23:50:48.108024Z","submitted_at":"2018-09-08T14:14:03Z","title":"Faithful Multimodal Explanation for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02805","snapshot_observed_at":"2026-08-12T16:56:10.983765Z","title":"Faithful multimodal explanation for visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.983765Z"},"links":{"cited_paper":"/paper/1809.02805","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:12a1d47c08b706e0154fabff2a06c6349e7230aff34bb41ecee251ea54733a7a","observation_id":"ee4ee791-962b-4d0f-942f-74020e33c9b6","resolution":{"observed_at":"2026-08-12T16:56:10.983765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.639410Z","title":"Generating deep networks explanations with ro- bust attribution alignment","venue":null,"work_id":"813a62ec-367f-4810-9f72-7663f6c938aa","year":2021},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.989040Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:f2103fe407a5fc3609742a2dd740c54def985892fe20bdcb951a3d11d089dd87","observation_id":"22389f54-2720-41f5-87f6-600ed372e1df","resolution":{"observed_at":"2026-08-12T16:56:11.645013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.615330Z","title":"Overlooked trustworthiness of saliency maps","venue":null,"work_id":"62d4a96c-25b8-484f-8183-b8990ee223e1","year":2022},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.994196Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:125634425a6275b0b0941f76d4252fa205362f6c8d6e05c7b7f19e698a4e88bf","observation_id":"3385db47-7dfb-4201-9f7f-fa0d384329c2","resolution":{"observed_at":"2026-08-12T16:56:11.625479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.595444Z","title":"Rationale- augmented convolutional neural networks for text classifica- tion","venue":null,"work_id":"c7b8b3c7-4ea1-4b7f-ba79-bf78f76fb5fd","year":2016},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:10.999277Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:eb8b0de5b7bc3a5b100fefb08006fe2b2ad2069b0660e6cb52b7d22e99ac84c1","observation_id":"9009f5c6-94ed-4024-a78b-d3704f8243e8","resolution":{"observed_at":"2026-08-12T16:56:11.602286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.572734Z","title":"Magi: Multi-annotated explanation-guided learning","venue":null,"work_id":"ca552cc9-42d3-4323-a0da-1b86101d4440","year":1977},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.004590Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:4065c1137bfa0d5ac87c9d240652544f4ea732d3040b923593eaa031bea651c0","observation_id":"7a6b2583-3e64-4014-bb1e-e766050e673c","resolution":{"observed_at":"2026-08-12T16:56:11.580092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-12T16:56:11.010184Z","title":"Multimodal chain-of- thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.010184Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:3e9933614fb9a6922c3450c5c5894674378c4e357d0a4b2ad62f47dee686a3cc","observation_id":"8bf2ff17-5b71-4991-baa1-284d17bae969","resolution":{"observed_at":"2026-08-12T16:56:11.010184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06985","last_updated":"2024-10-04T05:00:24Z","snapshot_observed_at":"2026-08-13T05:27:29.124242Z","submitted_at":"2023-11-12T23:14:43Z","title":"Large Language Models are In-context Teachers for Knowledge Reasoning","version":3},"cited_work":{"arxiv_id":"2311.06985","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.06985","snapshot_observed_at":"2026-08-12T16:56:11.094809Z","title":"Large Language Models are In-context Teachers for Knowledge Reasoning","venue":"cs.CL","work_id":"39699ff5-757f-47ce-af81-3f0f04a11b90","year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.016101Z"},"links":{"cited_paper":"/paper/2311.06985","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:d12edda7151add2c50944a0cfde6faf35003305071ca7b0d4018c128c556d03c","observation_id":"e1490300-7fa8-440c-8905-86b3073586b7","resolution":{"observed_at":"2026-08-12T16:56:11.102813Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:56:11.022673Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.022673Z"},"links":{"citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:2f27c4d7886aa56b05f553a84c3f8e470ade2e82c3961c820e7952f8c623d2a9","observation_id":"7c2640ea-c721-494c-ad29-d2389b7c5fed","resolution":{"observed_at":"2026-08-12T16:56:11.022673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-13T00:44:34.883184Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-12T16:56:11.028503Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:56:11.028503Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2411.13053"},"observation_digest":"sha256:69fe0d47a8fd7e7781f68e44dacfb1d969f209a8ca4014b609506a54640dea0e","observation_id":"17642f7c-15d3-42c4-8bf7-dba8934526a6","resolution":{"observed_at":"2026-08-12T16:56:11.028503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13053","last_updated":"2024-11-20T05:57:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T23:50:21.753084Z","submitted_at":"2024-11-20T05:57:00Z","title":"MEGL: Multimodal Explanation-Guided Learning"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2411.13053."}