{"as_of":"2026-08-10T20:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f2542229562a4baa238da94327befa48810153133c8d5cb0e3e6c7dc694e76a","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:24:07.449352Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00365/citation-record","integrity":"/paper/2502.00365/integrity","json":"/paper/2502.00365/citation-record.json","paper":"/paper/2502.00365"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.220580Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.220580Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:934e7a01521dfd0e1b7f5529cad1664b23c7c6bf752c4a8dd2b2de09d3b6e9bd","observation_id":"bc06a780-e6ff-40b9-9653-6a30edada75e","resolution":{"observed_at":"2026-08-09T19:24:07.220580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.225375Z","title":"and Alimoglu, F","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.225375Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:28a78b46b0f1f7bc00cab18440cd3040b40daab8be0b7c9ff688a0da092757c1","observation_id":"a1cb619c-c37a-47e3-bef2-bac2a7360d3a","resolution":{"observed_at":"2026-08-09T19:24:07.225375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.491340Z","title":"and Hoff, A","venue":null,"work_id":"7bf93054-1fb6-4cc4-a27e-45e5decb2627","year":1994},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.229412Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c0f22cb06118ddba576aaacbd616584e284979d5f23eeca9e0be350caaf410cc","observation_id":"3a56951e-7710-4deb-aa46-467a0d77d9c7","resolution":{"observed_at":"2026-08-09T19:24:08.494359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.482214Z","title":null,"venue":null,"work_id":"6582c07f-8fe1-44d6-b1f3-852dba6a8010","year":1974},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.236521Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c5b3024df19fa1599877a91aba58ada49155a519e258c2f5579dc61728d940cb","observation_id":"8c6e7541-cf78-489e-b704-8eccd31c4e36","resolution":{"observed_at":"2026-08-09T19:24:08.485341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.473289Z","title":"and Kohavi, R","venue":null,"work_id":"511a1416-8ae3-4328-95b4-4a0a87d3ab5c","year":1996},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.240868Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:4ced005bbf6be0d3690eca28438ceb16ed7ce2477d4990fad3782c82d7ea4520","observation_id":"bf1de2d0-87a5-4ad6-ab8b-043426033cbf","resolution":{"observed_at":"2026-08-09T19:24:08.476555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.463966Z","title":"Robust optimization for deep regression","venue":null,"work_id":"983c289e-6e2e-4b26-ae4d-a580901fe0ab","year":2015},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.244383Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:5dce76c3b5da796c3f85a04f1137c992ef94102e0de41247e529b31e06339ca2","observation_id":"25cb8e31-2074-4a09-b1af-aef41b20c368","resolution":{"observed_at":"2026-08-09T19:24:08.467507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.248029Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.248029Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c2ea93a208ee2ddb733987b71d4c53c93b8aaf5b5eafbb92275516b899b32953","observation_id":"3f3a58c6-e8b1-475e-96c0-d39e6efe0e0e","resolution":{"observed_at":"2026-08-09T19:24:07.248029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.450242Z","title":"MAGIC Gamma Telescope","venue":null,"work_id":"26085926-68f8-4eea-b14c-9cd64149253c","year":2004},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.252084Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:ea3f506754185c00cd573ce8306158bebd796fa7795b4d4cb9fee074c16b99db","observation_id":"56ac6a19-9e12-4743-ab8f-984b3251b77d","resolution":{"observed_at":"2026-08-09T19:24:08.453340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-09T19:24:07.255536Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.255536Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:9cda83f92d14abb712d4db3305918f7519e6238d39e8987622fb2b2e04df1297","observation_id":"b494ed5b-7455-460a-9d9a-eab8947c729d","resolution":{"observed_at":"2026-08-09T19:24:07.255536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03006","last_updated":"2018-09-09T16:58:33Z","snapshot_observed_at":"2026-07-06T07:00:02.059075Z","submitted_at":"2018-09-09T16:58:33Z","title":"Performance Metrics (Error Measures) in Machine Learning Regression, Forecasting and Prognostics: Properties and Typology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03006","snapshot_observed_at":"2026-08-09T19:24:07.259300Z","title":"Performance metrics (error measures) in machine learning regression, forecasting and prognostics: Properties and typology","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.259300Z"},"links":{"cited_paper":"/paper/1809.03006","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:86fe2339e3dea53117f31107b0d2793ebfc4e54b9da3c19e73c03bc8f0c4e480","observation_id":"9dadde10-4a38-49e0-9022-f99b9b89a99d","resolution":{"observed_at":"2026-08-09T19:24:07.259300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.440922Z","title":"A new typology design of performance metrics to measure errors in machine learning regression algorithms","venue":null,"work_id":"89ad50af-a69e-46e9-84c2-b62ca6b4ad96","year":2019},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.263002Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:a685b635ab21623733c10f9742a061eaf5889b2d96c96b8e57758f78684f06fd","observation_id":"9cabfe39-4174-405a-aa83-2097e0a5d013","resolution":{"observed_at":"2026-08-09T19:24:08.444544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.432272Z","title":"Classification and Regression Trees","venue":null,"work_id":"4be423e6-5d15-4247-8adb-c470c8714b1d","year":1984},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.266552Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:8c676d26df32d65b4ff670eebef4bab24040149129e0d0394fdf81089bbef8b8","observation_id":"a682e3dd-0a4b-4aaf-b9e4-804c8330548c","resolution":{"observed_at":"2026-08-09T19:24:08.435458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.422607Z","title":"Embedding Synthetic Off-Policy Experience for Autonomous Driving via Zero-Shot Curricula","venue":null,"work_id":"656eda8d-eb2e-43ac-8748-66ae973b8d65","year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.269977Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:2b837015405822dad3e45c12357b9c5b95404c1d9eaae1802d33c8233e2dcb4f","observation_id":"dc566bcd-3845-4b49-94f2-9777cdd793e5","resolution":{"observed_at":"2026-08-09T19:24:08.426258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.412726Z","title":"Loss functions for binary class probability estimation and classification: Structure and applications","venue":null,"work_id":"6422ccc9-4fd0-4a41-aa05-78bd0bf6d285","year":2005},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.273083Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:3a7a59cc8ab6c4948687fee895ad434f45ea0434026b1dbee4bc27f901a647d3","observation_id":"e88cfe19-9591-4a37-8ee8-b8a7a1c4bb95","resolution":{"observed_at":"2026-08-09T19:24:08.416193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.402917Z","title":"D., Martinez-Plumed, F., Tenenbaum, J","venue":null,"work_id":"3cace604-f736-42fe-a760-fd6155d5e542","year":2023},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.276225Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:d13e473a6df97ed9e8ca848b442539dee6b589dd1c4b9bb74a712f5eccb4c160","observation_id":"8df7019c-b004-4186-aa9c-a8fe2a2a40af","resolution":{"observed_at":"2026-08-09T19:24:08.406276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.393503Z","title":null,"venue":null,"work_id":"a1c02e71-2db8-4744-b7ea-cbf727f6fc55","year":2000},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.279424Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:113c80d6b68443c616dcf74866741da11a48d03e90b631b3ce2b7a0cb3564cf6","observation_id":"021064d6-6f86-4f6f-8d92-278a833f2aad","resolution":{"observed_at":"2026-08-09T19:24:08.397107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.384429Z","title":"and Lemaire, V","venue":null,"work_id":"7e7a571b-a71a-4fa5-aa8e-261bc993b32b","year":2012},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.282644Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:ddf7e71995fda8b08b72a0adb0494bdafde54c479b85f64168d99db0d43bf84d","observation_id":"44a2ecd3-2365-4daa-bcb8-1e9462eac07a","resolution":{"observed_at":"2026-08-09T19:24:08.387634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.042457Z","title":"and Guestrin, C","venue":null,"work_id":"49b4e0cb-631f-4643-aa06-a4587ba3d2a6","year":2016},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.285674Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:04bba9138016b94b83278d06af52ab910a7c76321cf9a3249bb811c3668160c7","observation_id":"0d873ac9-886b-4415-9ccc-56e364c790be","resolution":{"observed_at":"2026-08-09T19:24:08.046046Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.375245Z","title":"J., and Jurman, G","venue":null,"work_id":"2838f10a-d25c-4be6-a092-5e0f5b910d22","year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.288806Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:551bc03bb2052ebe45161e88ec2602b007a2eb7cd920925c007071fb963d3d25","observation_id":"ae69c9a7-cba2-4647-adb8-bc578c5efce9","resolution":{"observed_at":"2026-08-09T19:24:08.378566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.292405Z","title":"Support-vector networks","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.292405Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:640481800209be245002e8c88eb01440440a355c680a5e41c88260577683db9d","observation_id":"e9991980-64d1-4545-94bc-0d3c527ea8f3","resolution":{"observed_at":"2026-08-09T19:24:07.292405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.360378Z","title":"Learned lessons in credit card fraud detection from a practitioner perspective","venue":null,"work_id":"33621cfc-af5c-426b-973f-cef88b4f711a","year":2014},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.295835Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:88f35b0afed292f7c680b86bb73c6e1ece8bf3ac600e4902902d0611b11c0b7f","observation_id":"6d9635ad-3036-4685-b8b3-47c47cef0f02","resolution":{"observed_at":"2026-08-09T19:24:08.363947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.351407Z","title":"Bold: Dataset and metrics for measuring biases in open-ended language generation","venue":null,"work_id":"905e2759-2521-4911-9017-64fec312b42e","year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.299076Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:968c2264e7136459f13efa187bcd21d4514bf1c67774ad89d3fee774ac6051dd","observation_id":"8309e03e-28e5-44b7-b9ad-9260efbf3340","resolution":{"observed_at":"2026-08-09T19:24:08.354727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14618","last_updated":"2024-04-22T23:06:42Z","snapshot_observed_at":"2026-08-08T18:42:25.777499Z","submitted_at":"2024-04-22T23:06:42Z","title":"Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14618","snapshot_observed_at":"2026-08-09T19:24:07.302286Z","title":"V., and Awadallah, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.302286Z"},"links":{"cited_paper":"/paper/2404.14618","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:7dab883a10fc85f305c8ace27d449cee605085974efbdb4e217d922f794e1ce2","observation_id":"f36df912-854e-40b9-b8d0-d525ae3e5d4c","resolution":{"observed_at":"2026-08-09T19:24:07.302286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.306003Z","title":"Bootstrap Methods: Another Look at the Jackknife","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.306003Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c335f7915ca3ec6447978f3889d05be5366eee65855e6918b7203f64bc7f2dbf","observation_id":"edc28fc9-099b-4614-91d0-f1176657afb2","resolution":{"observed_at":"2026-08-09T19:24:07.306003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.342366Z","title":"Estimation and testing of forecast rationality under flexible loss","venue":null,"work_id":"8137a63d-9100-4104-8f96-58c2db1cdacf","year":2005},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.309220Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:e1bc3cc95d27b901df521a1edd7722216768a219ab966ca4a4740c23d0e220ab","observation_id":"a872dede-967f-4d00-ad13-417317b12585","resolution":{"observed_at":"2026-08-09T19:24:08.345646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.333630Z","title":"Reward function design in reinforcement learning","venue":null,"work_id":"3b99dd32-5ed3-494d-a1e0-df1a983ede07","year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.312397Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:50c908e17ea2cc599c6f29874edcb2fc0559f40aec20077a910f7afff93cbfd5","observation_id":"97fc06c5-9e59-4a72-8cae-6903d7442ae1","resolution":{"observed_at":"2026-08-09T19:24:08.336698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.325352Z","title":null,"venue":null,"work_id":"63745361-9bcc-4265-8598-f19aae38307d","year":2020},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.315600Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:d0f316148980fc52db3a9db198820fa0897a4765cf5c69c2545a92c5438183a6","observation_id":"2240c1a5-809f-49ba-ac15-5343b4f1c010","resolution":{"observed_at":"2026-08-09T19:24:08.328293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.316243Z","title":"Unveiling the robustness of machine learning families","venue":null,"work_id":"4ca36e20-8659-4893-b5a3-255820360bcc","year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.318950Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:563d391da1408ed0a5f339aed63c4837bcef6b6a25649ce8f9ef8ef9896d6b1f","observation_id":"66df1865-44e0-48b9-ac6c-79724414719f","resolution":{"observed_at":"2026-08-09T19:24:08.319618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.307586Z","title":"An introduction to roc analysis","venue":null,"work_id":"a6d4dfc8-f8a7-44b0-9994-edfbbe68a0a5","year":2006},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.322026Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:31cbc8b8859b42edc5be37773d3edc89323f26473be78a27ad1c691584d275c3","observation_id":"af0ab72b-e4c3-4b3a-a0b7-18a79c1a9913","resolution":{"observed_at":"2026-08-09T19:24:08.310624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"stable/2841583","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.850516Z","title":"Regression towards mediocrity in hereditary stature","venue":null,"work_id":"fd1bed11-05e5-429b-9c64-9657f2205660","year":null},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.325101Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:9ea4083bf7b215ccbd6daf615ae29618d6f046c751f52ad58235f821e6fdae58","observation_id":"c4a4fca1-7958-433a-a2ec-afda57794752","resolution":{"observed_at":"2026-08-09T19:24:07.855256Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.298820Z","title":"and Raftery, A","venue":null,"work_id":"024bdc26-fe77-47ac-9018-0902cabd12b0","year":2007},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.328581Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:22c0f89955181ee890a6610fcf3070041ea5aca24e580149e3196f81c486617a","observation_id":"17af1824-cfde-4ae0-a70c-7eb8e3269118","resolution":{"observed_at":"2026-08-09T19:24:08.302197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.290030Z","title":"and Ozhegov, E","venue":null,"work_id":"af2fdfb8-0800-400a-a517-1c22140ba255","year":2023},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.331776Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:3fa6fbc947a8d72036fad8f8085ab3be3a940f739e856cbc4b99d85afe39ecb0","observation_id":"54ee706c-4cc4-4797-90e1-38133107410a","resolution":{"observed_at":"2026-08-09T19:24:08.293336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.280810Z","title":"A unified view of performance metrics: Translating threshold choice into expected classification loss","venue":null,"work_id":"891366ee-3d53-4ed8-be2c-15b69b930fb2","year":2012},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.334837Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:5b58de39909a3de600cfc6696608f9bcf8c52b2f38e653d84ac1e1f679fc538a","observation_id":"6068d844-0382-4ab1-a55a-fd76c8033ccf","resolution":{"observed_at":"2026-08-09T19:24:08.284152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.270986Z","title":"Training on the test set: Mapping the system-problem space in AI","venue":null,"work_id":"b1932209-1310-4ed3-abec-ed711267361b","year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.338028Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:5b6a944877db07fbf5414b855383709df7b1a06e032875c07636e78fd9bf816d","observation_id":"3253b21e-7cd9-498e-b9ea-f065a89f8758","resolution":{"observed_at":"2026-08-09T19:24:08.274387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patcog.2013.06.014","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Roc curves for regression","venue":"Pattern Recognition","work_id":"0c7366a4-3c51-4d1c-8f6d-d4044856a357","year":2013},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.341206Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:39cdd285e56cbd880ac19493d6d747f8f8f4111ff8cf62877c42dbad7dbf7da8","observation_id":"ff4d94d5-8441-4f87-899d-9c0a8476ed8f","resolution":{"observed_at":"2026-08-09T19:24:07.504272Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.344722Z","title":null,"venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.344722Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:bfadbae323c353309d1fda61aa8e76ee9b07a0b17f9e9eebb982477534250937","observation_id":"2b2d1865-32c4-4a87-804b-a27e571781c9","resolution":{"observed_at":"2026-08-09T19:24:07.344722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-08-09T22:21:33.340392Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12031","snapshot_observed_at":"2026-08-09T19:24:07.347981Z","title":"J., Bieker, J., Li, X., Jiang, N., Keigwin, B., Ranganath, G., Keutzer, K., and Upadhyay, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.347981Z"},"links":{"cited_paper":"/paper/2403.12031","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:fd14d0cfc205693a02ecf7e46fd7168ffde12b9ce686d806aa05a0af89e35866","observation_id":"21db112c-1166-45f5-97c0-75e382e395bc","resolution":{"observed_at":"2026-08-09T19:24:07.347981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.351447Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.351447Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:3d51e38dcfac869da037adc384c4e9483a2856841290fbeb925a7025102805c6","observation_id":"1f0bffc1-06f2-4a7b-b5ba-795dac859cd1","resolution":{"observed_at":"2026-08-09T19:24:07.351447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.252136Z","title":"and Waegeman, W","venue":null,"work_id":"caef9856-7b9c-414e-8a3c-e37d2657deb9","year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.354560Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:b0f3f892fe3170973c227e16f4f45e7fcd2d87ca263cc18b0e4f1d851818dc3c","observation_id":"dde0cf6d-4bb9-4ee1-a28e-36065b86ecb1","resolution":{"observed_at":"2026-08-09T19:24:08.255151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.243814Z","title":null,"venue":null,"work_id":"26d3417e-6f67-4480-884f-d1ed619941d5","year":2006},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.357699Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:8bf85732df14ee17191aa5e1ff0d011b3960dec428d147cad147ee52c9d19c59","observation_id":"a7604de0-65fc-4e2b-894d-b154f0139155","resolution":{"observed_at":"2026-08-09T19:24:08.246874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-09T19:24:07.360812Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.360812Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:53cc8ed30c60d8c7939160c827184151da3cfa204ccffbf3dd35c3e0ce3a93fd","observation_id":"cbc4ec16-8042-45b0-9ce2-de6a24e15ce9","resolution":{"observed_at":"2026-08-09T19:24:07.360812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.233508Z","title":"Song popularity prediction dataset","venue":null,"work_id":"d64328eb-c2c6-45ba-a910-2d5f3f3bbe41","year":2021},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.364294Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:647abc374591c36a2cbbe70acb7839cf7c9df35798ea4f80a4b43a372bffda4c","observation_id":"34b65ede-a3b1-445b-8515-19ffd1d4e7e0","resolution":{"observed_at":"2026-08-09T19:24:08.238480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.224935Z","title":"Lightgbm: A highly efficient gradient boosting decision tree","venue":null,"work_id":"16b612db-45cf-4c5c-9cd8-01c7c5cbd313","year":2017},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.367588Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:be3a24b0187a56f81274fee5395d721dba8ac20cbd2d248b790514e6b3b05d86","observation_id":"bdcda004-24b3-439b-889b-3a823886ff99","resolution":{"observed_at":"2026-08-09T19:24:08.228165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.371015Z","title":"and Barry, R","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.371015Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:fe99a59e0e05c2328f89cfc43f98315559010698894c92f9ae11a83cb736e721","observation_id":"89a5517f-6a89-457f-b45e-fcb610fd766a","resolution":{"observed_at":"2026-08-09T19:24:07.371015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.374333Z","title":"H., Neumann, F., and Trautmann, H","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.374333Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:7c0fd38d29d3030b8287d25e576dc0c9c574df5c952852a8230c7e9f16cf3f1e","observation_id":"1eb34ae9-f65c-4de2-8011-a5e97dd83d85","resolution":{"observed_at":"2026-08-09T19:24:07.374333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.215057Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":"6cb79d72-ebc0-4e57-87bc-bb0ea9e026d7","year":2023},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.377655Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:aff23ca4dd98b8f5c117d22d5e627b575d20d81abdecaa14ce63360b50bb97c8","observation_id":"44eba3b0-0a69-4165-b2a6-a3e97df594af","resolution":{"observed_at":"2026-08-09T19:24:08.218998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08692","last_updated":"2023-11-15T04:40:43Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T04:40:43Z","title":"Routing to the Expert: Efficient Reward-guided Ensemble of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08692","snapshot_observed_at":"2026-08-09T19:24:07.381061Z","title":"Routing to the expert: Efficient reward-guided ensemble of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.381061Z"},"links":{"cited_paper":"/paper/2311.08692","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:a527b379c1df732998e2bfb435d0e623dbafe837c899c3318f838b49e48cb1ff","observation_id":"517ea66b-70f8-406e-be2c-9311ec9283b1","resolution":{"observed_at":"2026-08-09T19:24:07.381061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.205957Z","title":null,"venue":null,"work_id":"c2bb5001-625a-47c7-b123-6f30ba1b1b61","year":1943},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.384690Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:8dbc6245f4fca9ca65b5611f5b0fd988d20b3ea536308fcfefba5fbb0335f083","observation_id":"de4c19e0-29fc-45e1-bf86-739017d0608b","resolution":{"observed_at":"2026-08-09T19:24:08.209067Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.197551Z","title":"and Di Stefano, J","venue":null,"work_id":"2893cdea-6410-4422-b322-1f20a4c735cd","year":2004},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.388016Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:354e1c8fec9109b67f3da637337a8d00aca53061f2568444a7daf5b7d02fda52","observation_id":"f2626513-d3e0-49ff-bf64-82c87d9809ac","resolution":{"observed_at":"2026-08-09T19:24:08.200586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.188679Z","title":"A data-driven approach to predict the success of bank telemarketing","venue":null,"work_id":"5294d1a6-d63c-48c3-8a9c-a98db4df226c","year":2014},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.391118Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:1539edf59973e5c31af91471c13bad415b2e9134953243e8f07b444f3a26fceb","observation_id":"8d780f16-0ef6-4d4a-a066-af7c3507bffe","resolution":{"observed_at":"2026-08-09T19:24:08.192025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.180060Z","title":"Abalone, 1995","venue":null,"work_id":"48d2eaf6-ed5d-412f-a773-7d52d4a4cd23","year":1995},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.394155Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:5bb4f3f3b939aa3e7e653231125f0b34b8a3c4533dea7db1b61cee55afa38144","observation_id":"781aac97-894a-4da9-bebe-508d951c6f7b","resolution":{"observed_at":"2026-08-09T19:24:08.183089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.706560Z","title":"Analyzing and predicting verification of data-aware process models–a case study with spectrum auctions","venue":null,"work_id":"94ebbfdb-4233-4158-9cb7-afab2a5a2f21","year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.397377Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:698a4a0e461b0ec35b2203eb3fb47c95b5b1a512e1d722655cffc177acde0d28","observation_id":"cfa919e5-5bdd-4c43-bcbc-cbb938d8c5df","resolution":{"observed_at":"2026-08-09T19:24:07.711415Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.171444Z","title":null,"venue":null,"work_id":"365091b3-f3bf-48d5-b1fd-11bbc34b5319","year":2007},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.400487Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:7a9378d46d98ed56e61513caf39bb5aa3668d941318264b27818d4c1471c665e","observation_id":"07f84bf2-3f9e-4b67-b4e8-232338f45ba3","resolution":{"observed_at":"2026-08-09T19:24:08.174543Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03563","last_updated":"2024-09-05T14:19:45Z","snapshot_observed_at":"2026-08-09T07:59:30.785256Z","submitted_at":"2024-09-05T14:19:45Z","title":"100 instances is all you need: predicting the success of a new LLM on unseen data by testing on a few instances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03563","snapshot_observed_at":"2026-08-09T19:24:07.403555Z","title":"G., and Hernández-Orallo, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.403555Z"},"links":{"cited_paper":"/paper/2409.03563","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:0dd6fdfa76810770edbc83b3567d308e66b5156d7208625c3bd3851626d46ca1","observation_id":"85be6463-29c7-4331-8188-af8664c70f2f","resolution":{"observed_at":"2026-08-09T19:24:07.403555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.162199Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"15fe32d9-977e-4f66-a373-01257b9aacab","year":2002},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.406897Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c8d8a891142879c542e1aa5dc575d7dd6665b6ae512772967a98ef31346555cd","observation_id":"5b999616-a6fe-426c-96e5-dc4bc85b8229","resolution":{"observed_at":"2026-08-09T19:24:08.165847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.153215Z","title":"V., and Gulin, A","venue":null,"work_id":"de934c30-f94d-4ac2-9aa0-36551c33b1bf","year":2019},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.410105Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:6902020849bce1c4e4189a94be2b06b921d3d606a660235f7206b6a82bffffc2","observation_id":"8c855313-784f-4963-8bdf-e8610faa3204","resolution":{"observed_at":"2026-08-09T19:24:08.156405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.00058","last_updated":"2021-04-06T12:37:35Z","snapshot_observed_at":"2026-07-31T05:07:24.208700Z","submitted_at":"2020-11-30T19:21:44Z","title":"PMLB v1.0: An open source dataset collection for benchmarking machine learning methods","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.00058","snapshot_observed_at":"2026-08-09T19:24:07.413079Z","title":"D., Le, T","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.413079Z"},"links":{"cited_paper":"/paper/2012.00058","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:8b9b4d00e375c610d0011925151c873d3dd6b42db2c4082a6542c57a64fd0c6b","observation_id":"baa94ab7-9aa7-4ce8-8115-8c5485408bd2","resolution":{"observed_at":"2026-08-09T19:24:07.413079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.144020Z","title":null,"venue":null,"work_id":"0b440124-b3cc-4a6f-ba72-b095b7076bf7","year":2005},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.416519Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:e7c78cd1926c03b976a9e5e2d13d67f0ec2532c9bc0e11f540a8614c955b0af2","observation_id":"7eddb7c8-4be9-4f2e-ab7a-7dcab32d13bf","resolution":{"observed_at":"2026-08-09T19:24:08.147109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.134338Z","title":"A proposal for scaling the scaling laws","venue":null,"work_id":"146a0724-d4a5-408d-8150-b9d5b7b1467e","year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.419683Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:19105451572318bb90fc45e3ffc520c69d911e8533d82c8f194d165a3919f766","observation_id":"c1898210-e063-415f-b22b-3753f2849864","resolution":{"observed_at":"2026-08-09T19:24:08.137753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.125243Z","title":"Analysing the predictability of language model performance","venue":null,"work_id":"9f3ae0b3-556c-4f2b-acb6-a826a8c82c61","year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.423006Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:de66e690211f3619b56267a023bc6106adc2c30fb5b5cf8a6b7a13f02c2b821b","observation_id":"c9503ed6-d078-4cba-9c74-c0648e231e80","resolution":{"observed_at":"2026-08-09T19:24:08.128556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-09T19:24:07.426125Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.426125Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:5ccbd0aec840dc5a2b499af92299fc3b00e8e94edea96aaca195cea3b52a5507","observation_id":"7b5876a9-c16f-4e69-9d71-a48e00bc9db8","resolution":{"observed_at":"2026-08-09T19:24:07.426125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:07.429740Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.429740Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:4ea79f427f2d9ad7f9c09ae845fcfd98424ae2ce4f8ad4df8b47d423a62594ef","observation_id":"9ebe9feb-0d52-42e1-a058-6cf4b740462d","resolution":{"observed_at":"2026-08-09T19:24:07.429740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.116017Z","title":"A., McSharry, P","venue":null,"work_id":"a77641d1-69cc-45fe-a333-54b4d458c1c9","year":2009},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.433016Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:24c4d6f335ecd49cc1150b7e43d35088854a837b2227415390b0c3a18495a431","observation_id":"0c1ee8f8-6974-4c61-b7ee-8fc3a3f87455","resolution":{"observed_at":"2026-08-09T19:24:08.119412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.106074Z","title":"Facial and oral temperature data from a large set of human subject volunteers, 2023","venue":null,"work_id":"f8d92c0b-97d0-4bba-a7f2-db5d9feded1f","year":2023},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.436445Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:d90bd51e3e9a7a30005f6945b5a2a0b73a956509a2e703c705b662223f9ba516","observation_id":"4a7f802e-54e2-4f43-81e8-7c5f4e2b5a93","resolution":{"observed_at":"2026-08-09T19:24:08.109410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.097096Z","title":null,"venue":null,"work_id":"6a55c02a-9655-4fdc-8a25-744369afbf19","year":2014},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.439808Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:12dd5f637fa9bf902a0979f78abf1d8b7e194be86989672f8100731d8886b4b4","observation_id":"1a3ba552-8ec0-453b-9e7b-7e8399c44ec5","resolution":{"observed_at":"2026-08-09T19:24:08.100312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.088028Z","title":"Global health observatory data repository, 2015","venue":null,"work_id":"cdb19bf7-bf7e-4c2b-b929-b62e904a2492","year":2015},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.442874Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:061002011a28ba820a59f85b450a31ba19ee95750ca4975578779b6a2612989a","observation_id":"9d7b61d0-a598-4c12-a678-6251aa2d3c15","resolution":{"observed_at":"2026-08-09T19:24:08.091617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.078587Z","title":"Team formation through an assessor: choosing marl agents in pursuit--evasion games","venue":null,"work_id":"fc5d868d-b0d3-47b2-98d1-70b02eee2a85","year":2024},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.446053Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:c3670e53a7c4bafc40a5bd89b6627981ef3a4f2e89f9a0c2fb0a67fad6ba30f9","observation_id":"db3b2850-bf1a-41ca-90e5-056ce4618d7b","resolution":{"observed_at":"2026-08-09T19:24:08.082225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T19:24:08.068167Z","title":"Reject before you run: Small assessors anticipate big language models","venue":null,"work_id":"29265371-8b29-4465-8a49-cd7063e9e119","year":2022},"citing_paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-09T19:24:07.449352Z"},"links":{"citing_paper":"/paper/2502.00365"},"observation_digest":"sha256:91e13a3eaafaa9cb842e9e8db3e8ae9d1742f3810e219a55d22abcb1aebcdc61","observation_id":"b4bab923-8d4b-4991-b0e3-69d723ff6fea","resolution":{"observed_at":"2026-08-09T19:24:08.072387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00365","last_updated":"2025-02-01T08:41:57Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T23:57:05.618692Z","submitted_at":"2025-02-01T08:41:57Z","title":"What should an AI assessor optimise for?"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":4,"verified_fuzzy":37},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2502.00365."}