{"as_of":"2026-08-16T00:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6caae0bff669b918bc273d77bbaf20f3d7fea0b249ad217cf02079ca737a05ca","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:27:15.532176Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01588/citation-record","integrity":"/paper/2501.01588/integrity","json":"/paper/2501.01588/citation-record.json","paper":"/paper/2501.01588"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-10T22:27:15.489330Z","title":"Phi-3 technical report: A highly capable language model locally on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.489330Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:5456659754039ec083e185ff42de2e398d97b4d84f533cc67e31baac7ca55dca","observation_id":"d6ad1e48-9f66-42ca-a3fb-5aaf9ef04a85","resolution":{"observed_at":"2026-08-10T22:27:15.489330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11966","last_updated":"2024-06-26T07:16:42Z","snapshot_observed_at":"2026-08-13T00:16:49.895003Z","submitted_at":"2024-05-20T11:47:13Z","title":"Multiple-Choice Questions are Efficient and Robust LLM Evaluators","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11966","snapshot_observed_at":"2026-08-10T22:27:15.493787Z","title":"Multiple-choice questions are efficient and robust llm evaluators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.493787Z"},"links":{"cited_paper":"/paper/2405.11966","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:e8f32348112ef300d41d1576f7b7bee3f622f951df8d894f0cfe390bbab570ef","observation_id":"84b44dac-f64b-40f5-9aea-4a0366644dc4","resolution":{"observed_at":"2026-08-10T22:27:15.493787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:15.660149Z","title":"Generating multiple choice questions from a textbook: Llms match human performance on most metrics,","venue":null,"work_id":"a61902d0-10ef-491c-ba31-e1acffd15741","year":2023},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.497723Z"},"links":{"citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:c716217b8b24d8eb5ff69b476a5676cfbb5d814a7b60f216063992375b6bdf89","observation_id":"d12c1df2-7bcf-45d2-b124-caaef8f28beb","resolution":{"observed_at":"2026-08-10T22:27:15.663550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-10T22:27:15.501335Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.501335Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:fd59f25c5bd133abc4f15a493861ead9bf83e75f852547459b6829b398d1801a","observation_id":"90df8baa-0b88-4629-973b-b0de585f97bf","resolution":{"observed_at":"2026-08-10T22:27:15.501335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:15.650588Z","title":"Can multiple-choice questions really be useful in detecting the abilities of llms?","venue":null,"work_id":"c232453e-059e-47f6-b5bb-dc739b75f677","year":null},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.504985Z"},"links":{"citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:c3fecdfb5a34e4218532601eaa3eefa094571a8d201d2d9682d074da25660033","observation_id":"1d586043-adb9-49e9-b4f0-6e2c49dbf84b","resolution":{"observed_at":"2026-08-10T22:27:15.654071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T22:27:15.508868Z","title":"Hellaswag: Can a machine really finish your sentence?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.508868Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:353eb779b9cdc411e348e705db0d240cd4601363df16c3653f2bc129dec8a728","observation_id":"2de37227-0c18-46f5-8f7f-268f4cc607e1","resolution":{"observed_at":"2026-08-10T22:27:15.508868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-08-14T04:48:01.875703Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-10T22:27:15.512501Z","title":"Winogrande: An adversarial winograd schema challenge at scale,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.512501Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:d4cf6bc68e0a09035235ee3c53db9061a5d2e0d0edaf99adddda1d41f8664b12","observation_id":"890337d4-9d63-444e-a079-8bfae93a0a4e","resolution":{"observed_at":"2026-08-10T22:27:15.512501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:27:15.638325Z","title":"Training verifiers to solve math word problems,","venue":null,"work_id":"02eaeed8-966a-4624-9ea2-cceb3314690e","year":null},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.516467Z"},"links":{"citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:35fd162096032e4e4040b1ed59beb42b5768b42fbac54c941f8787eddc9644db","observation_id":"d8a34c59-aec6-411b-a581-99709ea201e5","resolution":{"observed_at":"2026-08-10T22:27:15.643613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T22:27:15.522694Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.522694Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:b24931ef2237942c620ccc5ab4f2153690bf9bcdf6216b583eafad19c2ee8e94","observation_id":"7bb84f82-5f93-4eb9-aee6-1fa1d99be9a7","resolution":{"observed_at":"2026-08-10T22:27:15.522694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07545","last_updated":"2024-06-11T17:59:47Z","snapshot_observed_at":"2026-08-14T02:25:43.490006Z","submitted_at":"2024-06-11T17:59:47Z","title":"Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07545","snapshot_observed_at":"2026-08-10T22:27:15.525599Z","title":"Open-llm-leaderboard: From multi-choice to open-style questions for llms evaluation, benchmark, and arena,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.525599Z"},"links":{"cited_paper":"/paper/2406.07545","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:54d8113cfcfd3401a381e6a2241b5debaa5fa2a32baef1d5e56be851a54f6ca1","observation_id":"117e356c-b6e1-43d9-90c2-85c131bb3dff","resolution":{"observed_at":"2026-08-10T22:27:15.525599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T22:27:15.528407Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.528407Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:87dac932c6367fcc713aecc619618899a5f7c48b24be8bf1df5647776fb7b14b","observation_id":"90ee99b9-3907-473d-8c89-1cad6d325aa5","resolution":{"observed_at":"2026-08-10T22:27:15.528407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-10T22:27:15.532176Z","title":"Truthfulqa: Measuring how models mimic human falsehoods,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.532176Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:6039d7d5998f3fda9065064788fd6a08a1d79872199f7cb0c08e29879cc4bdd1","observation_id":"47590e5e-a39f-4910-a352-27a662850092","resolution":{"observed_at":"2026-08-10T22:27:15.532176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T22:27:15.519792Z","title":"Available: http://arxiv.org/abs/2110.14168","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T22:27:15.519792Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.01588"},"observation_digest":"sha256:0a151768aa56a90979859bc5448ab162d7673a56aedef3528ba216cbd44dc691","observation_id":"85e783e0-b169-4857-82a0-eabc38ecdb0b","resolution":{"observed_at":"2026-08-10T22:27:15.519792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01588","last_updated":"2025-01-03T00:56:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T21:53:22.135929Z","submitted_at":"2025-01-03T00:56:46Z","title":"(WhyPHI) Fine-Tuning PHI-3 for Multiple-Choice Question Answering: Methodology, Results, and Challenges"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2501.01588."}