{"as_of":"2026-08-10T18:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72bb3aa2db8f01e464ba6c8d5fb22c8dfb2ddfef621d05d41e22972536b0231c","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:17:25.752626Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04006/citation-record","integrity":"/paper/2608.04006/integrity","json":"/paper/2608.04006/citation-record.json","paper":"/paper/2608.04006"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1702.34626","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.069430Z","title":null,"venue":null,"work_id":"4fd49523-d53b-46b4-a6d1-b687ea1c52a0","year":2021},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.519264Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:0a3735456b5664b07c5f287534fcd472aaa0648350320960cc95752815194618","observation_id":"d0b9b2bd-a355-4627-892c-193d3bc84468","resolution":{"observed_at":"2026-08-05T04:17:28.074828Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.225444Z","title":null,"venue":null,"work_id":"48667814-fec9-47ec-96d7-61af17ad4210","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.523150Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:b87cbb216207192302cffe7d3d796fb41d9b012702fa4c32b0d5fe25a2fda20f","observation_id":"4d0f3b01-e00d-490e-ba98-f3ffcc80bcca","resolution":{"observed_at":"2026-08-05T04:17:28.228884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.215228Z","title":"Boyatzis","venue":null,"work_id":"b3037d2c-f027-4c27-a45f-f61794f62c54","year":1998},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.527464Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:68cff3d36abf8281466594aadb26ba76d20cd56bc9405b5b05dd0aae1ef88135","observation_id":"f2b9a4be-81af-45a3-8a03-204ab8b41254","resolution":{"observed_at":"2026-08-05T04:17:28.218287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07213","last_updated":"2020-04-20T19:10:58Z","snapshot_observed_at":"2026-08-08T06:44:34.550459Z","submitted_at":"2020-04-15T17:15:35Z","title":"Toward Trustworthy AI Development: Mechanisms for Supporting Verifiable Claims","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07213","snapshot_observed_at":"2026-08-05T04:17:25.530897Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.530897Z"},"links":{"cited_paper":"/paper/2004.07213","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:fb807f859a58f02cbeabc6451f723ea8ba98492b457ffffd7bdb5755a830bc03","observation_id":"32097df6-c747-4e76-b359-08ab98db3585","resolution":{"observed_at":"2026-08-05T04:17:25.530897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.534928Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.534928Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:8d7684ba4c258021576bdb0af044239c01eca6fa2193923761ea4925733e6496","observation_id":"82a8d80b-654f-4054-b132-d02a75a82079","resolution":{"observed_at":"2026-08-05T04:17:25.534928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.205246Z","title":"Chall and Edgar Dale","venue":null,"work_id":"e93d3866-0c10-4060-9da9-81c62f9e8126","year":1995},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.538821Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:f62b24d4f97910db785395618c28f1a1278317841efb7e818894c3a2328d19b3","observation_id":"9cc9d71c-7904-408c-9dc9-8131e01e3bd7","resolution":{"observed_at":"2026-08-05T04:17:28.208419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.33608","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:27.908393Z","title":null,"venue":null,"work_id":"8ee0bf1f-8f00-4f60-863f-3c9fc330495e","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.542673Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e073cafe77108878e3f2e33134e67baab5e38e4fffd0b757a377643a23a00ff7","observation_id":"ed7805cb-c620-4390-a760-8c7e30277c70","resolution":{"observed_at":"2026-08-05T04:17:27.913035Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/cgf.14034","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Chatzimparmpas, R","venue":"Computer Graphics Forum","work_id":"0be1774b-accb-41fb-bc35-cdd6255275a4","year":2020},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.545754Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:0803d37529d18a41262de307a8ed010b61158fa39d023c65d7091052a215da29","observation_id":"2b123157-29b2-44f9-a0af-f96247549d68","resolution":{"observed_at":"2026-08-05T04:17:25.951670Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.548811Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.548811Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:8f64eb59155ae3d7f494fe769772ed48fe54cfea170ca8f5aa576ce97bf6b80a","observation_id":"44736a45-114b-428b-b69e-c168714213d7","resolution":{"observed_at":"2026-08-05T04:17:25.548811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.551817Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.551817Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e9971e0151bc7ed1bc80d75038eaf98422cb105af5d469341ac5085140765d3e","observation_id":"75017310-8ab0-4f80-83fa-b50d5109df04","resolution":{"observed_at":"2026-08-05T04:17:25.551817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.555266Z","title":"Choi, Scott Crossley, and Alex Endert","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.555266Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:2d862fdd9a48a71a7789bfcedd079758d14cd1c18c56b20a6907af1d59009661","observation_id":"1d681a6a-416f-45e4-890a-4e5d1e6b3380","resolution":{"observed_at":"2026-08-05T04:17:25.555266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.558453Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.558453Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:8a5d6273f41506c3e46480e2a296bb17f1d3a4cb1a35d272a9f01e7a658b341b","observation_id":"f2d4d483-0348-43b1-84d2-3327d3079cc9","resolution":{"observed_at":"2026-08-05T04:17:25.558453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.561351Z","title":"Cotton Debby R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.561351Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:a7fb808c3ec358a283ca21539c302a8c08cbb58e917a2f2e8cdf8190b7b07f6e","observation_id":"d1c1f518-4932-401f-99a0-7798e34090d6","resolution":{"observed_at":"2026-08-05T04:17:25.561351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.193635Z","title":"2018.Learning engineering for online education","venue":null,"work_id":"879619f0-c0fd-49ff-9ac5-1f06614be4a6","year":2018},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.564802Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:deab6308a65a5dd0c0ced860fc809208faf23143e5cd1a03b0d22b5b6f021c4d","observation_id":"3df318eb-2d61-4e60-a484-cb8adb009796","resolution":{"observed_at":"2026-08-05T04:17:28.197113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.567872Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.567872Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:691d59e0263598a1c906c63b178f9ef59e6b73a92ff5837b96bd6a72284424c4","observation_id":"88e3bec6-6de1-459e-be40-9024be83b130","resolution":{"observed_at":"2026-08-05T04:17:25.567872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.571140Z","title":"2016.Fair Statistical Communication in HCI","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.571140Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:d0ae6aa8f06570d8dd9770c43ff4f40dcb15766fc24ba4d3ce47ae4a98b4914d","observation_id":"875ba092-bd60-42f2-8aed-9cd0d69437dd","resolution":{"observed_at":"2026-08-05T04:17:25.571140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.11152","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:27.475975Z","title":null,"venue":null,"work_id":"6f124e83-7b6a-4931-99c0-caefa39e8b6a","year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.574490Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:65b9e4bd163f55d41855e5e48d78a326d2e0db199c3fe443634db86c03886ea7","observation_id":"4d493dbc-7d11-4cef-994a-1c6f21a323d4","resolution":{"observed_at":"2026-08-05T04:17:27.480915Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jrp.2008.07.011","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:46:29.746714Z","title":"Evans and William Revelle","venue":"Journal of Research in Personality","work_id":"96a61042-49e3-466f-ba2c-41f90fe66295","year":2008},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.577516Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:c351beda5057bf6eb61e3654d46c916c50ceefd3020b35c198ddbecd28bd1e82","observation_id":"db604a32-a62b-40a1-b3b4-f4af6ba6f987","resolution":{"observed_at":"2026-08-05T04:17:25.928515Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.581303Z","title":"Niles, Ken Pathak, and Steven Sloan","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.581303Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:19ed40a176c0b38dae49a0c674071a736df85f5c3b890da590eee584efc60407","observation_id":"7fa60858-f46d-4f6e-a58a-444fc4ec4b7a","resolution":{"observed_at":"2026-08-05T04:17:25.581303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.584432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.584432Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:5d07e9546b051e1c10776ba9decb8418c05502658240dce44b49352450ca4f23","observation_id":"0194dd3a-c008-4134-8f36-85c1ac60bd80","resolution":{"observed_at":"2026-08-05T04:17:25.584432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.587689Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.587689Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e0cd62f67840a4a821c9d7ec804c7573002fddc7376bab5c0ecdbe3ecb9fd9d3","observation_id":"3d6b0fd6-fe6f-4b28-b6e7-b3b1a102469c","resolution":{"observed_at":"2026-08-05T04:17:25.587689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.590868Z","title":"Kummerfeld, and Elena L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.590868Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:ae279cc1f24d6a6f826b3038f9a2d2916f76485fc4db706c78002a6399156a86","observation_id":"14530e9f-7f29-450f-867d-276f75538ad0","resolution":{"observed_at":"2026-08-05T04:17:25.590868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.594050Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.594050Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:68ed6d3c7f56bb4607fce3856ada6e20356021903ba0d3abdd4c9b7f8681a783","observation_id":"227dfd76-7086-4a8d-96ff-839a9a16dfde","resolution":{"observed_at":"2026-08-05T04:17:25.594050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.597174Z","title":"Silva, and Huamin Qu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.597174Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:d78eda7015f4f2fb759f1c023e8d9ac436cd09dd6e6ab0193d94ded9bb0b6205","observation_id":"10cf6621-9f8b-49cd-bbe1-5ec9145fffe5","resolution":{"observed_at":"2026-08-05T04:17:25.597174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T04:17:25.600323Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.600323Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:225725ecfff3443e3d48a5eeb3d32c8870afb3a26c6fe4357a232c677b9e667f","observation_id":"61f5b9b8-0773-4946-ae8f-a64bb72c34bc","resolution":{"observed_at":"2026-08-05T04:17:25.600323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.603718Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.603718Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:9526901c6d32f8b4f7c22c549359fe681863833b29aa48c14d04791793fc64c6","observation_id":"c7cf5795-a515-4e8f-8049-6c58f13caecf","resolution":{"observed_at":"2026-08-05T04:17:25.603718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.607073Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.607073Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e25a58343e5f9fd9097c8250d488ae36daef671b1170bb2a5e147bb9eab51a3a","observation_id":"dd0c0db3-f9d6-4509-a8f4-626f270a60fb","resolution":{"observed_at":"2026-08-05T04:17:25.607073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.610052Z","title":"Santos, Mercedes T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.610052Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:d621d5e0ff93634cd42b07959b130fe763b8a5e99d31a1b7150be6a7313571df","observation_id":"d810c320-1f47-4856-99b8-af88a63b6530","resolution":{"observed_at":"2026-08-05T04:17:25.610052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.31234/osf.io/pz98q_v2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":null,"work_id":"504832ee-29d1-4f1c-8353-28db1ff7cc2a","year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.613131Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:ed0e0c57ccfcfdea47042dd869bf1ea9e93adfab88d1a3465c7cc960caa7b873","observation_id":"8ce53605-0020-466e-8367-30852ece5706","resolution":{"observed_at":"2026-08-05T04:17:25.888008Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.183764Z","title":null,"venue":null,"work_id":"f43ace3f-28a7-4cc8-8776-d0554d58cd97","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.616232Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:90b37b4632dcf96bb150c31180c423e0603c785f3210facb8b4c4b976da3bd43","observation_id":"54ae552b-709e-4e9c-bbe0-a78a496a6b71","resolution":{"observed_at":"2026-08-05T04:17:28.187022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.174031Z","title":null,"venue":null,"work_id":"6e8526c1-56f1-4a50-8fc8-c9f6360dc790","year":2015},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.619280Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:fa122c151a42d956e6fd586eb3f5b6f2d4ddfd98cbd2396a58b254bce8424daa","observation_id":"b7b778fd-c711-4f94-ab89-10e78d300e0c","resolution":{"observed_at":"2026-08-05T04:17:28.177327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s40561-024-00310-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Smart Learning Environments","work_id":"c9ea8042-6f21-4325-9e9d-fbe3d1f098d4","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.622584Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:06788abe4c6d40cae0fdd53ebc25a0d238b0d67fab2f229d8c73f9e86867e2b0","observation_id":"b8140797-550a-4407-a561-a57e2163dc1c","resolution":{"observed_at":"2026-08-05T04:17:25.878861Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.625657Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.625657Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:6dc5f2c40337fdfd4dea6173f3fb1e6932cc038f057a0ee5fce47d8c63033c97","observation_id":"8685f45a-b86a-4e56-9879-b5cb6a351f3a","resolution":{"observed_at":"2026-08-05T04:17:25.625657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.628744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.628744Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:5145a7067216f8ffce2086280897359c5d0edc3e2ed58e7c2fe53062786c58c9","observation_id":"dd859138-2c75-4614-96ec-79f8d88f9e00","resolution":{"observed_at":"2026-08-05T04:17:25.628744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.631977Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.631977Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:f5a320741baa2505c95cecc177eacd3d26d78e0bf494cff817b5290c1eb0f58c","observation_id":"69a063b8-78c0-48c8-9a8d-3028bee07b3d","resolution":{"observed_at":"2026-08-05T04:17:25.631977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.634972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.634972Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e85d67d1c9cc273d71d8800242dbcde390da324be61d2d7057c6e29169e353d3","observation_id":"8ce6bcf4-d65b-463f-830d-26da24cc49b3","resolution":{"observed_at":"2026-08-05T04:17:25.634972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1177/009155217800500302","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"Community College Review","work_id":"e2e78035-5c14-40bb-a6e0-6d13b0bc26c3","year":1978},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.637963Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:18f3041d0785c695c440e4ca869d62b33b12999f16078c6d2a01f52ed94cb635","observation_id":"2cad3874-0751-4c4c-bcb8-2d6aa1c9d444","resolution":{"observed_at":"2026-08-05T04:17:25.869515Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnl","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.857074Z","title":null,"venue":null,"work_id":"2eeeb141-e7ca-4768-bed2-653052ab8130","year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.641098Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:e4de2a0e88b8da87f1b347e271b82b38d803dc1efc29aba34da5f72f0149f143","observation_id":"35d8d073-4566-4d42-b0eb-4d3d0418c8be","resolution":{"observed_at":"2026-08-05T04:17:25.860212Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.644344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.644344Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:9c5f9021319fe500c7087e202e2a05f770ce70ea8a77843c839496baedd1536c","observation_id":"55e40df2-1b96-4f0b-b735-7899196689c0","resolution":{"observed_at":"2026-08-05T04:17:25.644344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18710","last_updated":"2025-07-01T15:49:58Z","snapshot_observed_at":"2026-08-10T17:04:52.375523Z","submitted_at":"2025-06-23T14:49:01Z","title":"Benchmarking the Pedagogical Knowledge of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18710","snapshot_observed_at":"2026-08-05T04:17:25.648174Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.648174Z"},"links":{"cited_paper":"/paper/2506.18710","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:2a5be4d902137a592f498cd40a79b5bffe7fac9b49d1bdce29b0a2a9ead3371a","observation_id":"da3fb9dd-9cfb-47b3-acdd-2272bc508f34","resolution":{"observed_at":"2026-08-05T04:17:25.648174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.651541Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.651541Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:99dae417e6629e97372c4107e502c7d3183908cd289bae13b94c7186162a4c58","observation_id":"7c1bb6c2-808f-4bbc-8648-ba79cabd1425","resolution":{"observed_at":"2026-08-05T04:17:25.651541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.654730Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.654730Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:756f41a1e12587d70c3f4769e0ad7b72bb6cc720f12826d52cc5f665f941dfde","observation_id":"0d46df98-b86f-4768-87e8-8ab4ae98b7c1","resolution":{"observed_at":"2026-08-05T04:17:25.654730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15326950dp3801_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"McNamara","venue":"Discourse Processes","work_id":"a2df4f97-afd8-4a97-aeaf-7aee2b79534e","year":2004},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.658064Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:af912c7442308dea2eb03a93b9a3d7d9f3dc864393aa790239b0ab803ffd0e61","observation_id":"a5c11e32-e59e-4624-8beb-076f67a10b41","resolution":{"observed_at":"2026-08-05T04:17:25.837124Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s13040-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.823127Z","title":"Meyer, Ryan J","venue":null,"work_id":"b5a4af0f-b6b8-42ca-8d0f-cb4a0a75320d","year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.661108Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:5d3d250ea672d5c0d628a3a670f50f663f25c2dc5e543e01a31a1a0031f14496","observation_id":"aa96bea0-915e-4874-95e8-6f48479be79f","resolution":{"observed_at":"2026-08-05T04:17:25.826689Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.664187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.664187Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:23cf8116571e5303106941a27fbcd0e062748f64345ab2411f75b053861a5894","observation_id":"ec2813f7-7d6a-4109-bd14-cb6e7a9ed939","resolution":{"observed_at":"2026-08-05T04:17:25.664187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s40593-024-00395-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:12:12.796739Z","title":null,"venue":"International Journal of Artificial Intelligence in Education","work_id":"b7f2ecdb-86f8-45af-abcb-3b5458cde4c5","year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.670666Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:b9aaacd31e976d1055f50a87e5f1139ce3fc9ce668d6f4b76264db6b451bb8aa","observation_id":"62a52659-1a4d-4784-a00e-3e2755f1cf62","resolution":{"observed_at":"2026-08-05T04:17:25.814895Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-36336-8_75","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T06:12:12.796739Z","title":null,"venue":"Communications in computer and information science","work_id":"6c8c0d6a-d45f-461f-aa35-71405e0c2f74","year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.674087Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:3ec99640e6339db6598e03171c6e173d752f673921f7451f6f425f5cf7d52059","observation_id":"49e93b01-a8c5-4f22-92c1-4c9c2e1e8aa3","resolution":{"observed_at":"2026-08-05T04:17:28.161534Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.677364Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.677364Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:46825624c0107ce6b7f5b00a9f2e161c771f0afc33d20f8243d12c03279946b4","observation_id":"11756212-782b-4a52-b7b2-d356878dc42f","resolution":{"observed_at":"2026-08-05T04:17:25.677364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.680300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.680300Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:f34091bb2f7cc3f9bed9ef13cf05ded84dc8b22306f4c2e6006edfd124682bea","observation_id":"85b7bc1f-834c-43d1-be9a-7898879273b0","resolution":{"observed_at":"2026-08-05T04:17:25.680300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.147428Z","title":"2009.The coding manual for qualitative researchers.Sage Publications Ltd, Thousand Oaks, CA","venue":null,"work_id":"961cef02-6721-411a-aec4-bff7b5abedc1","year":2009},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.683585Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:6831917feae86479dec8ec4c506082be4b788cd88c06af64455f45ac391a09ba","observation_id":"62920620-dd08-4210-aaa4-3a90b73559d5","resolution":{"observed_at":"2026-08-05T04:17:28.151385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.687112Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.687112Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:9758fafa1ae2ccf45ff96fa4680042840eacb3acae36d1d8379019754629db74","observation_id":"f1e74a28-8d47-4da0-8b8d-bcfcbf771a51","resolution":{"observed_at":"2026-08-05T04:17:25.687112Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.690460Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.690460Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:a714fe42af390ccd009a51a2ccd32715def1d033c1068fc4dd9cbfd1af88f3ae","observation_id":"fe875396-a795-4e47-ba8e-953ed584c171","resolution":{"observed_at":"2026-08-05T04:17:25.690460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.693807Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.693807Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:b985bd1d7379d65d59894f2c3ff1d5234fd5c5047b9e6b375ff4fafeb36b48b4","observation_id":"3995da2a-6ce7-4010-b5ec-b9aefcdae529","resolution":{"observed_at":"2026-08-05T04:17:25.693807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.131693Z","title":null,"venue":null,"work_id":"4ddb50e8-3139-4146-8015-3a4b5e3e5f18","year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.696813Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:1ca466d91700a27664eb57a641b550d45395ec08b6aff7f5002c19390b0796a3","observation_id":"e5ef4551-b352-45b8-87cd-004e6cf96f76","resolution":{"observed_at":"2026-08-05T04:17:28.134744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.10189","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:26.626001Z","title":null,"venue":null,"work_id":"ce21682b-dbe9-4887-bc25-418c0d4cb533","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.699735Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:4eddb00887bef1b8d12ebd5f3f9591edec860f3226963a6488323e4b3b916ca8","observation_id":"5a5f5257-5107-480f-9139-0b247adcdf54","resolution":{"observed_at":"2026-08-05T04:17:26.630759Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.703101Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.703101Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:209e3371864d1e02a7495b1624ab9deabfd4744c53d4fe737953a356802c8aa9","observation_id":"319e3d00-4811-4476-bfcd-6202462afeb0","resolution":{"observed_at":"2026-08-05T04:17:25.703101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.121937Z","title":null,"venue":null,"work_id":"1e11b469-6aa4-4333-b175-3fa1d74a79bf","year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.705901Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:b4c8dcdda1fc68385419b9565784719e5327afd6e33d3ab44a783e11d68f0efe","observation_id":"ec29528c-22bb-40d0-9994-90bb2a8c8c3b","resolution":{"observed_at":"2026-08-05T04:17:28.125301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.112057Z","title":null,"venue":null,"work_id":"9d236724-fc33-46e3-9f04-c3b1295860ca","year":null},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.709319Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:f16fb1a34e2670bb79ca6e8e6f00674db25b761785631a6b66d71138d54f2895","observation_id":"fbb5823f-d569-422c-bbfd-99d3edd146fc","resolution":{"observed_at":"2026-08-05T04:17:28.115619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T04:17:25.715612Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.715612Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:4fba993ff16b04366391276ac6a8bf946ae4f0d3fa992e3857bf163ed06e26bc","observation_id":"91f058bd-e177-406b-9fe9-5ba3d4e12767","resolution":{"observed_at":"2026-08-05T04:17:25.715612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:28.102442Z","title":null,"venue":null,"work_id":"e727c0df-3c0f-4494-a725-a63b09edb42f","year":2017},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.719048Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:7f9bf1a4d1b190613a343746c939e7e754a91f1f555f08da97bc99f61e5a48a3","observation_id":"f7ea809e-144a-4cdf-beb6-8e102e47db35","resolution":{"observed_at":"2026-08-05T04:17:28.105586Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.722177Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.722177Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:9df9b025043c9e834da9e63546379f368a49fdc6326473fdc51e3e8be67c8acb","observation_id":"7d2dbd14-f8a3-47ee-90a8-5dd60ae3cd6c","resolution":{"observed_at":"2026-08-05T04:17:25.722177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.725266Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.725266Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:ea79751c8a240ce87dd1823acb7be518481d0f59bb190816b45358590bf107e2","observation_id":"8b39378f-02bc-4e68-bfb6-2882d51fa539","resolution":{"observed_at":"2026-08-05T04:17:25.725266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.728488Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.728488Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:67d2f57168bc4de091bb665a2100954616a88abb68e2b0a31413a140452f1855","observation_id":"ca60be1b-8b51-4edb-89ef-6c3661c5af35","resolution":{"observed_at":"2026-08-05T04:17:25.728488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0762.37726","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:26.334992Z","title":null,"venue":null,"work_id":"f93deb13-a429-4137-b8f0-7125eb01a7db","year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.731391Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:0732330f9907a058334e0a69d1b588859a785deb384ff4f38f4b8a7fe36bcdb3","observation_id":"7be58548-2ab7-435b-a441-406e58de188f","resolution":{"observed_at":"2026-08-05T04:17:26.339570Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.734626Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.734626Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:d43a87d4f5a52e4d2215c3b5c136bd6a25d54c4bc15c20f21235757b825597c0","observation_id":"c64c99c4-ce22-42f5-a358-f4e7e01f439b","resolution":{"observed_at":"2026-08-05T04:17:25.734626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19540","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:26.211435Z","title":"Do I Trust the AI?","venue":null,"work_id":"3db72661-cb70-484f-a2d7-f533dd019495","year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.737824Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:4ba0d8c4aebae8d43976b81ee7d59253e0e468a9d157f441ac686e23d78399ea","observation_id":"4f268b3a-3570-4c46-84a5-0e9757238292","resolution":{"observed_at":"2026-08-05T04:17:26.216335Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.740804Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.740804Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:6b78c949da1a1a6b268ec677b97a866f2bbdfc11204ff6c70666f6b7eb67900d","observation_id":"9a5f494d-fe61-4bc7-83f0-5229d383dfa9","resolution":{"observed_at":"2026-08-05T04:17:25.740804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.743700Z","title":"Zamfirescu-Pereira, Laryn Qi, Björn Hartmann, John DeNero, and Narges Norouzi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.743700Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:53c3dd39fb1e15d2a64cdd1d779559716ee9437ae82b5883ecda822017468bcf","observation_id":"9af040a0-b000-4df1-b6fb-69fb2a41e24e","resolution":{"observed_at":"2026-08-05T04:17:25.743700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.746719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.746719Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:02a11b6dc2a097b1c2288823a6d02e46a3c6f3eec4cfa0e617f3dcd5f4d1df8a","observation_id":"0b66c1a9-e588-4812-826f-1f1524968030","resolution":{"observed_at":"2026-08-05T04:17:25.746719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.749791Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.749791Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:027846effeefee7e368019b9fbdf737c1c52a3b10c4b375ecb77773bff30d114","observation_id":"d7698cc0-707b-41db-9caa-4066f27e2546","resolution":{"observed_at":"2026-08-05T04:17:25.749791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.10435","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:26.074637Z","title":null,"venue":null,"work_id":"13e4b42c-1635-40aa-8f39-55d52d451c7b","year":2026},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.752626Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:c247cdc0ef668d40872264916bec121f73fc06b58081c7983b25ffb333268283","observation_id":"ad6dc455-f47e-4635-b539-ace4d981a8a6","resolution":{"observed_at":"2026-08-05T04:17:26.079705Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:17:25.712559Z","title":"InProceedings of the 2020 Conference on Fairness, Accountability, and Transparency(Barcelona, Spain)(FAT* ’20)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T04:17:25.712559Z"},"links":{"citing_paper":"/paper/2608.04006"},"observation_digest":"sha256:9d0758afc93d7e44ac12d2c653367dacde5b35bb6581df62b028f6ff18a9ecba","observation_id":"2297613d-7447-4163-a9fe-f3d9d57e7401","resolution":{"observed_at":"2026-08-05T04:17:25.712559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04006","last_updated":"2026-08-04T17:59:20Z","latest_version":1,"primary_category":"cs.HC","snapshot_observed_at":"2026-08-10T05:21:32.023857Z","submitted_at":"2026-08-04T17:59:20Z","title":"Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":3,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":50,"verified_exact":10,"verified_fuzzy":4},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.04006."}