{"as_of":"2026-08-11T05:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6316f4161402c52f6dee3f460f542412c06ba38d3af2e50f7422e62cb6b30ff","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:41:26.749626Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10744/citation-record","integrity":"/paper/2509.10744/integrity","json":"/paper/2509.10744/citation-record.json","paper":"/paper/2509.10744"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.324388Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.324388Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:d6ec559dbe14e7224b645ccc926e97cb3718b3b44d4896b9fe60263607350b48","observation_id":"8486a350-9521-4f10-84f8-264e20c14bf8","resolution":{"observed_at":"2026-08-04T17:41:24.324388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.392622Z","title":"2023.RADIATION AND CAN- CER BIOLOGY STUDY GUIDE","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.392622Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:f070d2a0208a3f47f5f7d31f49bcf1d08dec25eed753dfa983e0186b0dc881c6","observation_id":"42f280f6-3db1-4a6f-b8b0-d8da1ce95671","resolution":{"observed_at":"2026-08-04T17:41:24.392622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.466641Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.466641Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:c8efda35988b67cf814fe50e697271aadbb00c1995137c251e7b662de541511c","observation_id":"2723ce5c-c6d4-474e-854d-4209523dabdd","resolution":{"observed_at":"2026-08-04T17:41:24.466641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-04T17:41:24.542294Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.542294Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:8128ca71143f0cda8384691734a1ba755678a384efbd1190ccf2edbcc3216bbc","observation_id":"9ed580f0-67bd-44f9-ab7b-ad35badd4874","resolution":{"observed_at":"2026-08-04T17:41:24.542294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.ijrobp.2024.07.1346","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Beattie, S","venue":"International Journal of Radiation Oncology*Biology*Physics","work_id":"9cc073b0-cf71-4bb9-b5ee-e09d568ae3f0","year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.599332Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:484859ba3420fa7b32afc57dba66a26d899cfe5dc371ef9603bb754eb1575872","observation_id":"38455af8-88ef-45e3-b4cc-7a583862dd47","resolution":{"observed_at":"2026-08-04T17:44:06.657194Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.693090Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.693090Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:4585224cf7e5ecda294655f386f98f3c5a782a1c66e1e17d39064932a3a396c8","observation_id":"4361f049-0e8b-407b-a518-08ab7e77b44d","resolution":{"observed_at":"2026-08-04T17:41:24.693090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.730975Z","title":"2024.Science and Engineering Indicators 2024: The State of U.S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.730975Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:f0784df6bd08c19c9df9d6855ccb7bfccd6c54386363b18d46f30023fa7f79f2","observation_id":"3180879f-8562-4e9e-aceb-d2f3dc9be986","resolution":{"observed_at":"2026-08-04T17:41:24.730975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.794393Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.794393Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:56e6f83463540022525951db02a0543ae721769b0dd8870e069cfbb6bf8bfc37","observation_id":"989a7007-af5a-41f5-b050-a7c96927f59e","resolution":{"observed_at":"2026-08-04T17:41:24.794393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-04T17:41:24.828179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.828179Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:30169353281384831fe8f4c2d3def163c07347948d90c22a681b9af746fab778","observation_id":"a6c64ead-25fc-4b2d-9c18-e5671b6153c4","resolution":{"observed_at":"2026-08-04T17:41:24.828179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:24.900523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.900523Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:1663f90f984069d459313d14ce60882173a4f7bdbfbc15e1de712c65063cbe36","observation_id":"4048d7d2-cec4-4399-aee4-bdcb8c762105","resolution":{"observed_at":"2026-08-04T17:41:24.900523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T17:41:24.955443Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:24.955443Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:b02b28eab36f512ef2c2cf9126103c6514deb9688e08e7306224ca72624b25db","observation_id":"c675e996-8c89-482c-aac3-1b4f477fddc5","resolution":{"observed_at":"2026-08-04T17:41:24.955443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.057261Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.057261Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:0a7722e96be388e50d1a52c251d3e402ce922e8e5962759a4470e4a2035b5b68","observation_id":"62aebe7e-b7c5-4516-ad99-d2d10bb53810","resolution":{"observed_at":"2026-08-04T17:41:25.057261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-04T17:41:25.150748Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.150748Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:bf74c1248f124e19d5a907f66abf2c3b92618d0cc354a53aba505075b8014eb4","observation_id":"e6a80fa6-8f8a-4100-b825-882ace8c95dc","resolution":{"observed_at":"2026-08-04T17:41:25.150748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.253320Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.253320Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:fa66c79b4d5445b0b9613ccba828ea6d2e67bd9981332683ec3daa7bed791a02","observation_id":"12cefcf7-075d-48fd-b8d9-25def0368f62","resolution":{"observed_at":"2026-08-04T17:41:25.253320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-04T17:41:25.356677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.356677Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:353bf7a74d98b0ff7ee54fb4f6b69248b70d0f86dd7208d520393f0dede0048b","observation_id":"f1e518fe-2069-408d-915c-6c20be29c67d","resolution":{"observed_at":"2026-08-04T17:41:25.356677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.470163Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.470163Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:b221497ca20917ffe60c29f974605ed790da7c3545ef13f33779ff9e237f503f","observation_id":"d27d0ddc-3885-4cf0-9321-4380fbebe63a","resolution":{"observed_at":"2026-08-04T17:41:25.470163Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.555929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.555929Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:900153ac97a49557974071c92247efbf2446bc40e2aebfbe044506551404321c","observation_id":"3d437974-6ad9-4d14-bf0f-ffd8a2cb1c7f","resolution":{"observed_at":"2026-08-04T17:41:25.555929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.608152Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.608152Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:72663de6c2fc572b84ad3cb85a24d5534c0d244d2c43e01551e3267e76617d7e","observation_id":"84c28f20-78fa-4c01-b41e-8b6ed0414fdd","resolution":{"observed_at":"2026-08-04T17:41:25.608152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:25.685924Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.685924Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:dbb3737ddafde4491524d5f48eb050ce9c6fbb66d1c085bd169f192810bed1b6","observation_id":"8a08fa86-f3d1-48a8-b5bc-162b2240f87e","resolution":{"observed_at":"2026-08-04T17:41:25.685924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-04T17:41:25.771827Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.771827Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:e406f7ee4d76c917e524b1b0623470084f6d9b039e37b849fa40962337f7413b","observation_id":"9c914f5a-12a2-4d9f-9177-e6e9d074ff7c","resolution":{"observed_at":"2026-08-04T17:41:25.771827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-04T17:41:25.884961Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:25.884961Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:ce375ff50d6ff68044b37ac923f308ede001e9bde570e68261101595a87ba3f7","observation_id":"fe18cd74-ba37-409d-8e09-481a06146177","resolution":{"observed_at":"2026-08-04T17:41:25.884961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.01435","last_updated":"2025-04-23T18:38:41Z","snapshot_observed_at":"2026-08-10T08:04:22.916864Z","submitted_at":"2025-04-23T18:38:41Z","title":"AdaParse: An Adaptive Parallel PDF Parsing and Resource Scaling Engine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.01435","snapshot_observed_at":"2026-08-04T17:41:26.013320Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.013320Z"},"links":{"cited_paper":"/paper/2505.01435","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:4fb6c5656acd4b62e2e0e6a1cb00c379f023f38ddf373ffe4cd0e72abadf32a6","observation_id":"7439b183-a787-42a9-8c11-efce408a164a","resolution":{"observed_at":"2026-08-04T17:41:26.013320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T17:41:26.134486Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.134486Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:29a00d3d97f70dffccb9b0d7c8a0243f1440e19169dc9db5c044bc23a14c72fa","observation_id":"090749f7-9de1-42a0-8109-3e0e569522a0","resolution":{"observed_at":"2026-08-04T17:41:26.134486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11194","last_updated":"2024-11-08T22:00:26Z","snapshot_observed_at":"2026-08-09T14:51:30.631899Z","submitted_at":"2024-07-15T19:28:14Z","title":"AstroMLab 1: Who Wins Astronomy Jeopardy!?","version":2},"cited_work":{"arxiv_id":"2407.11194","doi":"10.48550/arxiv.2407.11194","metadata_source":"pith","pith_arxiv_id":"2407.11194","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"AstroMLab 1: Who Wins Astronomy Jeopardy!?","venue":"astro-ph.IM","work_id":"2dc9124a-6c02-41fc-bb33-05cc0bd2843f","year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.265139Z"},"links":{"cited_paper":"/paper/2407.11194","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:56e81cf46560d006d51ad83861a48851cbd0d234349a51ed07d8b21ab2d9a90f","observation_id":"dcd6ef8f-2025-4bdb-bd5d-88e958fd75f3","resolution":{"observed_at":"2026-08-04T17:44:06.150232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:26.408422Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.408422Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:229305980022afdaf3d491a34fb66fd9992088f80b932479f69e470b76f72e93","observation_id":"cc4e81db-6201-47b3-8dab-57b9685da8b5","resolution":{"observed_at":"2026-08-04T17:41:26.408422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:26.633666Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.633666Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:4972f871c636690bbbd2bb7fe9c36e47eb517c94f71a000da61a2d6e449412c1","observation_id":"d1ec3a66-d79d-44e4-8d7e-513ba62d7d8e","resolution":{"observed_at":"2026-08-04T17:41:26.633666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-04T17:41:26.749626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.749626Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:a8241410f8c142274cf75cffe6292f650e7f0433676102726619a1636892dc59","observation_id":"c24f4045-7edf-465f-b4bf-a04bb640e1fb","resolution":{"observed_at":"2026-08-04T17:41:26.749626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:41:26.516157Z","title":"InExtended Semantic Web Conference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T17:41:26.516157Z"},"links":{"citing_paper":"/paper/2509.10744"},"observation_digest":"sha256:510c7972a18f58f5e0323c5b77cde820a7fb0cdfe5d88dea8c06584196264643","observation_id":"7c317ed6-eaf3-4c24-9754-50e0d01248c6","resolution":{"observed_at":"2026-08-04T17:41:26.516157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10744","last_updated":"2025-09-12T23:22:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T17:32:50.298081Z","submitted_at":"2025-09-12T23:22:49Z","title":"Automated MCQA Benchmarking at Scale: Evaluating Reasoning Traces as Retrieval Sources for Domain Adaptation of Small Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.10744."}