{"as_of":"2026-08-11T02:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ee20ba2ed6ec8f7c5b4385091abbf669b1cb923ae008063f4a581dbaa47a867d","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:19.995889Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:17:25.648174Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T22:20:49.429444Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":"2506.18710","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18710","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V ., Mack- intosh, A., Portela, M","venue":null,"work_id":"c4300ceb-e853-4cff-a471-1cbbbbceaafc","year":null},"citing_paper":{"arxiv_id":"2604.06385","last_updated":"2026-04-07T19:16:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-07T19:16:50Z","title":"Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:55:17.077281Z"},"links":{"cited_paper":"/paper/2506.18710","citing_paper":"/paper/2604.06385"},"observation_digest":"sha256:f724a8c45a60fd5401a0a4a7b35b6cc9ad09d8ff0cc8fa13b40411c2d52788b8","observation_id":"b77a933a-aeb1-469a-ac90-b173740e58cf","resolution":{"observed_at":"2026-05-10T22:20:49.432408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18710","snapshot_observed_at":"2026-08-05T04:17:25.648174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.648174Z"},"links":{"cited_paper":"/paper/2506.18710","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:2a5be4d902137a592f498cd40a79b5bffe7fac9b49d1bdce29b0a2a9ead3371a","observation_id":"da3fb9dd-9cfb-47b3-acdd-2272bc508f34","resolution":{"observed_at":"2026-08-05T04:17:25.648174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.18710/citation-record","integrity":"/paper/2506.18710/integrity","json":"/paper/2506.18710/citation-record.json","paper":"/paper/2506.18710"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.683582Z","title":null,"venue":null,"work_id":"738d7196-9e1f-43df-a864-c283a991aa86","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.479564Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:46ace950c17a0650cabc73e1aea2fd375cbcc12476171625fa2fa5208e19793d","observation_id":"24bb187b-f29c-4585-9952-440af2095de3","resolution":{"observed_at":"2026-08-06T23:20:23.826962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-06T23:20:17.558649Z","title":"Biderman, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.558649Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:8c5741872f7ae3aabd166817950c6b0f5504d7193a63a4c8fc838a624a9abde6","observation_id":"cc8a224a-e939-4fd1-b83f-b674ead897e9","resolution":{"observed_at":"2026-08-06T23:20:17.558649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16338","last_updated":"2023-07-30T23:15:28Z","snapshot_observed_at":"2026-08-05T23:22:43.371393Z","submitted_at":"2023-07-30T23:15:28Z","title":"Distractor generation for multiple-choice questions with predictive prompting and large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16338","snapshot_observed_at":"2026-08-06T23:20:17.679991Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.679991Z"},"links":{"cited_paper":"/paper/2307.16338","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:1d1d3c1447dc7e15e95a9ddc838237019e4dbea2f91c1985e1fc0d947687c2bd","observation_id":"cb00ef13-f91c-4a82-ac67-dd4dde68a7a1","resolution":{"observed_at":"2026-08-06T23:20:17.679991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.396749Z","title":"Sastry, A","venue":null,"work_id":"cbb75213-e78b-433e-8b8a-4b8e55b3eb71","year":1901},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.780784Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:88f9a1e3a83c7360d05dddc6f681bc19d9d5957b0f8a4e2b58b7b798350e12bd","observation_id":"bea6d80c-6936-4123-94e9-6be154b57933","resolution":{"observed_at":"2026-08-06T23:20:23.535094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.171456Z","title":"Chang, X","venue":null,"work_id":"a17a64f3-e544-4ec7-b40c-8b621abe6420","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.859253Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:bae0559525a034098b0ec27185554287c54b4bfdbc582972c41df2b239cb50c6","observation_id":"1624f01f-6c72-46a0-89fb-34ca3ca107d9","resolution":{"observed_at":"2026-08-06T23:20:23.277396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-06T23:20:17.947382Z","title":"Chiang, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:17.947382Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:fbe563a4e313ed8991b88dc70ebc2ae85bb89a67f026cf7e6d42507751fd5235","observation_id":"c9655ea1-32ec-4989-b546-a732b26c6c9d","resolution":{"observed_at":"2026-08-06T23:20:17.947382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:23.003422Z","title":null,"venue":null,"work_id":"39cd9ce7-b700-4010-bf73-f3286c6f7944","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.025882Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:3cb5d08bf4596226efaddc1a888cb04133230554883456a640eade54e8ba4be1","observation_id":"ab6aa314-1541-4c9d-94fb-38a70c8ef7fc","resolution":{"observed_at":"2026-08-06T23:20:23.093985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-07-06T16:40:35.590974Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-06T23:20:18.098093Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.098093Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:d036211e24c269e677e73d888e740f2654a009f3c85aa45156fabcd0a4391112","observation_id":"b0f66b31-b1ae-4858-8d25-f3f518ecbbc3","resolution":{"observed_at":"2026-08-06T23:20:18.098093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19470","last_updated":"2024-11-11T02:27:54Z","snapshot_observed_at":"2026-07-06T18:38:09.490968Z","submitted_at":"2024-06-27T18:21:32Z","title":"Changing Answer Order Can Decrease MMLU Accuracy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19470","snapshot_observed_at":"2026-08-06T23:20:18.169890Z","title":"Gupta, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.169890Z"},"links":{"cited_paper":"/paper/2406.19470","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:0c3f64f82976d2796ac2298a4c510553b63e10be4ac75c49f80e1f8a16a17038","observation_id":"b6d1f93e-e3dd-4009-9000-70e8e9a4973f","resolution":{"observed_at":"2026-08-06T23:20:18.169890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T23:20:18.291469Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.291469Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:7d71e8e8eb34ccc17cc5a8d134e30b69de874005d4a23faa65e146e16bc62345","observation_id":"f814db51-67bd-4305-8466-5d994260db4c","resolution":{"observed_at":"2026-08-06T23:20:18.291469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:18.383691Z","title":"Kasenberg, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.383691Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:c1966dc532afff189c5ff6480fbd6f6369ef0f067eea05443719e25047ee2f32","observation_id":"a7977192-8b60-4100-8ec4-7b10630d5d89","resolution":{"observed_at":"2026-08-06T23:20:18.383691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10242","last_updated":"2025-03-13T10:34:43Z","snapshot_observed_at":"2026-08-07T17:07:29.741834Z","submitted_at":"2025-03-13T10:34:43Z","title":"MinorBench: A hand-built benchmark for content-based risks for children","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10242","snapshot_observed_at":"2026-08-06T23:20:18.494890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.494890Z"},"links":{"cited_paper":"/paper/2503.10242","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:f774b73e1a1c06a1dc9d9315b1ef200d48aef1a22a940d43e5dd851bb9449b15","observation_id":"a825aa2b-cc49-4c4d-bcc5-922451871eec","resolution":{"observed_at":"2026-08-06T23:20:18.494890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.715463Z","title":null,"venue":null,"work_id":"ee34a961-30e4-4744-9a78-713256e5381d","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.550027Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:a991089e0d57a0a890042c53855ec529a9dd9b9cffb99b95af902460ce3590d7","observation_id":"5ebea77e-c4d2-444b-ba25-befa5559ed01","resolution":{"observed_at":"2026-08-06T23:20:22.906863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:18.624386Z","title":"Macina, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.624386Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:3b35f9336233ebe9ec1ecc42aedd0efad5bca4dc99d0ceb5a5fa83486f1c4889","observation_id":"c44b9237-e4a4-420a-a847-6a0db5c20830","resolution":{"observed_at":"2026-08-06T23:20:18.624386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09880","last_updated":"2024-10-14T02:11:29Z","snapshot_observed_at":"2026-08-05T15:21:23.913810Z","submitted_at":"2024-02-15T11:08:10Z","title":"Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09880","snapshot_observed_at":"2026-08-06T23:20:18.697366Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.697366Z"},"links":{"cited_paper":"/paper/2402.09880","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:dc6f967d5bd2cd9bb82d1e6289fbb60736d1cb4dd1985a6de4a776c98ed7475c","observation_id":"2f1c3676-d795-4007-a5ca-e4cf5528221d","resolution":{"observed_at":"2026-08-06T23:20:18.697366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.391227Z","title":"Miller and K","venue":null,"work_id":"2e74a152-f05a-4fd5-accc-9eb3db5723a3","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.788322Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:dea62995b1df75d8a857d74548c40074359a1e2818f74a0a9c68c1462d83e4f8","observation_id":"2ec590f1-abd5-4724-a830-c2b6fc3b6637","resolution":{"observed_at":"2026-08-06T23:20:22.542405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:22.127742Z","title":"Nancy, D","venue":null,"work_id":"39e3d2c2-26bc-4da1-baca-7daf30bdbb3f","year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.858576Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:e34e218a617a66596012fa64be8fad88ade63e825b6a481b6b06e46b6c6a0ef8","observation_id":"66338182-1251-4ef6-9821-3d7cb07ade13","resolution":{"observed_at":"2026-08-06T23:20:22.232468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-07T01:33:49.598772Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-06T23:20:18.894389Z","title":"Pezeshkpour and E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.894389Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:856a40316abc678282b47ac3a6441c1b4f4dcafe7c8d68de0a5021aac7bfb3db","observation_id":"dcd55ea8-78ac-492d-8336-9986fa188871","resolution":{"observed_at":"2026-08-06T23:20:18.894389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.853546Z","title":null,"venue":null,"work_id":"5e785445-6deb-4302-bd96-57af8078acb6","year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:18.941933Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:df3a2587694c0da13a8d71ad7df605744632d1ac06e3fb97bed49221fbd5010d","observation_id":"f8c1cade-0438-4809-ab45-d0ef468f386b","resolution":{"observed_at":"2026-08-06T23:20:21.989970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T23:20:19.015163Z","title":"Gpqa: A graduate-level google-proof q&a benchmark.arXiv preprint arXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.015163Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:19c837c83d233da5ecd3a85a46371ab2cb78a922a39c7128375f2aa2c4df20b9","observation_id":"79513115-4e9f-4085-9aa8-aa8a4158768d","resolution":{"observed_at":"2026-08-06T23:20:19.015163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/tea.21676","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":null,"venue":"Journal of Research in Science Teaching","work_id":"706e5422-a8f1-4309-901d-6bdafe3ee58d","year":2021},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.083382Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:534ed5c651d78c429adf52539be7e0ed5848aba2919cda173f84f5700078230e","observation_id":"2f14bc13-72fa-4de4-9d86-c1a26c846bcf","resolution":{"observed_at":"2026-08-06T23:20:20.188179Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16429","last_updated":"2025-08-22T16:22:07Z","snapshot_observed_at":"2026-08-09T00:04:36.113158Z","submitted_at":"2024-12-21T01:34:05Z","title":"LearnLM: Improving Gemini for Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16429","snapshot_observed_at":"2026-08-06T23:20:19.149082Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.149082Z"},"links":{"cited_paper":"/paper/2412.16429","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:344d79758e344c7ae6d6814ef701c019ee5cf456aff0ca35aa3bfe5dc63d833a","observation_id":"f8914a9b-4d96-4faf-8417-c8c5e8d0b485","resolution":{"observed_at":"2026-08-06T23:20:19.149082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24477","last_updated":"2025-05-30T11:26:32Z","snapshot_observed_at":"2026-08-08T23:59:50.654290Z","submitted_at":"2025-05-30T11:26:32Z","title":"Evaluating Gemini in an arena for learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24477","snapshot_observed_at":"2026-08-06T23:20:19.262891Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.262891Z"},"links":{"cited_paper":"/paper/2505.24477","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:9c2e6e78ef1a52ef4d7143d050f7763a464fea34286cb5c8fe22c518eba67b88","observation_id":"80662d06-63a6-4f2f-bbd1-0c5299a439b6","resolution":{"observed_at":"2026-08-06T23:20:19.262891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-06T23:20:19.346836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.346836Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:7f32e2983c9510942eb71305ffa995193971685da5bb911573ac9f39c47c1567","observation_id":"256efb3c-ade7-419c-8204-c485a7f13395","resolution":{"observed_at":"2026-08-06T23:20:19.346836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18105","last_updated":"2024-04-01T18:47:45Z","snapshot_observed_at":"2026-08-05T22:34:48.476134Z","submitted_at":"2024-03-26T21:04:29Z","title":"Large Language Models for Education: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18105","snapshot_observed_at":"2026-08-06T23:20:19.392025Z","title":"Largelanguagemodels for education: A survey and outlook.arXiv preprint arXiv:2403.18105, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.392025Z"},"links":{"cited_paper":"/paper/2403.18105","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:0ad9630371f9bc9aac48f588576345bcafc588244303d38c20828af591d0807d","observation_id":"2210cf71-da4c-40ff-9f41-bf3ab00f527c","resolution":{"observed_at":"2026-08-06T23:20:19.392025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14499","last_updated":"2024-07-04T12:51:29Z","snapshot_observed_at":"2026-08-09T10:48:35.691807Z","submitted_at":"2024-02-22T12:47:33Z","title":"\"My Answer is C\": First-Token Probabilities Do Not Match Text Answers in Instruction-Tuned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14499","snapshot_observed_at":"2026-08-06T23:20:19.476553Z","title":"my answer is c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.476553Z"},"links":{"cited_paper":"/paper/2402.14499","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:80487dfec73d64ff1943fb5444479f51074e057ee29b9be1c0cb29a955ead2f5","observation_id":"c0bf046d-b888-472b-94a8-13ab792af7b1","resolution":{"observed_at":"2026-08-06T23:20:19.476553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T23:20:19.533268Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.533268Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:e2642b2eccbf128a98c243cd530ebd7ddbf6fc1563e17d406a0a04e6e4991d30","observation_id":"77f20ff9-76b7-42cc-85f2-bcabae8501c1","resolution":{"observed_at":"2026-08-06T23:20:19.533268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T23:20:19.618219Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.618219Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:ad8f837aa1a4ec0735f395ff5153937be36b361cb8e999d61e192f932e48cfbd","observation_id":"d81164cd-622c-4e6f-8ba6-db336f662f38","resolution":{"observed_at":"2026-08-06T23:20:19.618219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.671956Z","title":"Zheng, H","venue":null,"work_id":"b4fceaa0-b562-4967-a31f-aa90bd1ec45a","year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.682163Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:cde0e86636faeb9b02f64153c2c27c1ef0e1fd1262e686bb2852196bd57f2b52","observation_id":"6d599a70-0eef-4cc6-9f62-cbc8081f806e","resolution":{"observed_at":"2026-08-06T23:20:21.782219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.332770Z","title":"Wheredoyouthinkthereismoreplasticine?","venue":null,"work_id":"0ef0a26e-a2d6-457c-a217-4fb0f3e5e50c","year":2023},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.753332Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:d46018b4935d78df51dfe7a2561cc256ba0f8e82be4ed46400353f8efdbbbc21","observation_id":"fe32bd1a-bcbb-4f4d-8740-b4e7ef7995f3","resolution":{"observed_at":"2026-08-06T23:20:21.493176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:21.025318Z","title":"Question","venue":null,"work_id":"1f4aba2e-b7cb-4cb6-8662-87f4992e7e31","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.816947Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:0f2d032eaee9a18997bb7894fc19e82fd3417859f5b3b71b488b04b4e0ec657b","observation_id":"0846e8bf-2909-4ddd-af7e-d10ca4ffaa55","resolution":{"observed_at":"2026-08-06T23:20:21.120052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.877454Z","title":"The text is as follows: —– paragraph —–","venue":null,"work_id":"71e0139d-66e4-43a9-b7b3-4b648e01c1c3","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.868065Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:483ad7cf568d934dfaf993051672fce8ef607509490a46417fee9f2598df512e","observation_id":"a8232885-ba20-49c7-8ce3-03c1bca6a1c9","resolution":{"observed_at":"2026-08-06T23:20:20.945282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.770754Z","title":"question","venue":null,"work_id":"1dd708ff-9c42-409f-a963-f5a795de0490","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.914280Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:07ec89a2c6598c7b41d9e990dcf89a5828c3f0dc4ce65472d409eb2c0ace941c","observation_id":"99315814-de92-45c3-9951-84e64ec29d9f","resolution":{"observed_at":"2026-08-06T23:20:20.827125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:20.646692Z","title":"question","venue":null,"work_id":"3e914b39-a565-4091-9d42-e2d69f69c9c7","year":null},"citing_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:19.995889Z"},"links":{"citing_paper":"/paper/2506.18710"},"observation_digest":"sha256:0a856a56dcb0e02f3f6f7608620a3647bcde7034d6e6a78d32fc1fbb94d68cef","observation_id":"7278ccc6-e8be-452c-8a1c-6b0307cd8019","resolution":{"observed_at":"2026-08-06T23:20:20.698192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2506.18710."}