{"as_of":"2026-08-03T04:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3cd3c5735238b7c7a6b2d93b7e33725526948ed0ef943ea300e069146feba278","coverage":[{"denominator":287,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T10:03:58.971585Z","state":"measured"},{"denominator":155,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":155,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":55,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:59:21.087147Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:59.033645Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2306.05685"},"observation_digest":"sha256:70b2352098e29c45fc75c35165122e56119cfc6c6aff776cef1a132063f216ed","observation_id":"c1b92dad-805a-47d2-943c-dc989a98b5ff","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T23:46:39.330438Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2309.05653"},"observation_digest":"sha256:341427f6b493473ae9dd84a4163c78044720522a3915d17e6805592f0ab92e24","observation_id":"96043340-8524-4b05-94fc-ebaf9b2cb6df","resolution":{"observed_at":"2026-05-17T23:46:39.673387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-24T06:51:02.531751Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2309.10305"},"observation_digest":"sha256:0f4e15485dc7a59223229f2a3e98ecf5db9f134cd86092b4f75b961f04d3aaf5","observation_id":"4ffa988c-4a1e-4c9a-9fca-c8d94dfff545","resolution":{"observed_at":"2026-05-24T06:54:03.494391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T06:11:38.406350Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2310.06825"},"observation_digest":"sha256:cebe46906d11c49971207121514bef501f1c04db64160345d2766a9bdb334e32","observation_id":"f5134d17-bbc2-42da-b71f-ee7cedb4bc28","resolution":{"observed_at":"2026-05-24T06:14:00.055653Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-07-06T16:44:23.357719Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T03:18:51.582340Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2311.04257"},"observation_digest":"sha256:a1e45a7c07d703e560fb5aa686044f666bc3b0f8399f0d0a0ec05a53d6b5c92f","observation_id":"9644ed94-4617-459d-9b84-777600b65e97","resolution":{"observed_at":"2026-05-18T03:18:51.798370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:9996ea17363039dee336b5a29b48ec88c3a140e1b2c890e211f009f632a2d830","observation_id":"39ee5a74-f36c-49a6-928f-b280709feedf","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":226,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:7fe9aba0fc40f70ba79d99861a4fa9bcfa66b898095d597811f2d2e8a0a05d04","observation_id":"c718a91d-569f-407a-aaa2-36b2e00374d4","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:13.816153Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2401.01614"},"observation_digest":"sha256:e4aaa996d31f30fbe7da7c0100db769472f868090fb7632e892f4c7406b8790a","observation_id":"188b5ec0-8e54-4362-9e77-31e427c34247","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-11T06:08:05.550346Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2401.02954"},"observation_digest":"sha256:74405519567ad3cd0630cd2dfd74ccf7363180fe6874ca38af037ab1f0186158","observation_id":"29c50967-2771-46e4-b630-edde26399d5b","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T04:09:15.921778Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2401.04088"},"observation_digest":"sha256:7ae558f2b696931a9c822215f963d01110e58792ad03b527b06845a9cecc0c12","observation_id":"321e39c8-7012-4f44-9288-52993abeb961","resolution":{"observed_at":"2026-05-24T04:13:53.841009Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-24T03:23:18.827351Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2402.03300"},"observation_digest":"sha256:a6f8402bc8b7fde82db993d0bcc60c7de7bc2aa816f0c2a9eb225e41ea9ff85a","observation_id":"4283d2d9-6d40-47f3-9f11-39b38cf5d953","resolution":{"observed_at":"2026-05-24T03:23:49.423836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-02T22:29:36.344544Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T17:58:54.177359Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2403.05525"},"observation_digest":"sha256:a3c68d38f961cae6aa1766d198701fabb9b551c6ae83b1715ad319fc68fcafee","observation_id":"2906ed29-c1a8-46f8-91f8-639cc21f41b8","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-02T22:29:36.344544Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T17:58:54.177359Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2403.05525"},"observation_digest":"sha256:a6a34d92021831626724b72479986a7fbb4f604b26f2851d91fa3a5cb69df140","observation_id":"7403b0e0-3e8f-4a45-ada0-ab469dac8475","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:653d14fa4de1535ecb999358d8dc754ff8cc08b3bfce986b57f119b4efb6dd1a","observation_id":"82f29955-ba9e-46ba-a460-84dd8ebe4ddd","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T15:51:04.674346Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2406.01574"},"observation_digest":"sha256:734de7cbc60e2093f78d8747577a38f353c7fc844326b278b47e172932e90bcb","observation_id":"9b4d48db-aefb-4c5d-8d47-bff912511c6e","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"reference_index":220,"source":"pdf_text","source_observed_at":"2026-05-17T22:58:16.523267Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2406.11794"},"observation_digest":"sha256:a92b2b55694a3d9fb47bad7ddaf4bd2316cfe2af323651f808bd20bbe3a8e9d9","observation_id":"5a7a2327-af5a-4761-b4cc-95eb56ddd36f","resolution":{"observed_at":"2026-05-17T22:58:17.383933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T01:06:07.787696Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2406.11931"},"observation_digest":"sha256:644233b75acc706c0ed7558483c9e7bf4021b8ac443c295de9dfad2b56ab775e","observation_id":"43ffd89b-4280-4515-87bd-f45c3388ec8a","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T01:06:07.787696Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2406.11931"},"observation_digest":"sha256:0339d733dd9998e91d836c3004fde4a9d24c090740528f106bf95fece4f79324","observation_id":"8f1175dd-89d8-48f6-8840-c3271dc946ba","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:e858f7903b74b19058fafee718a386a51a45a63ad7807b57c6aa35026162308c","observation_id":"bc643947-5dc4-4ac4-b4fc-a6db1271f161","resolution":{"observed_at":"2026-05-20T06:20:36.324452Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2409.06624","last_updated":"2026-04-29T15:56:44Z","snapshot_observed_at":"2026-07-06T19:13:16.067395Z","submitted_at":"2024-09-10T16:26:43Z","title":"A Practice of Post-Training on Llama-3 70B with Optimal Selection of Additional Language Mixture Ratio","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T20:42:38.782232Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2409.06624"},"observation_digest":"sha256:812c6b0e7d9802ffe74a3854b7995699722ba45524fb1fc411b56d80fca8b823","observation_id":"3f745850-9722-42c9-9057-9f449b0d9d04","resolution":{"observed_at":"2026-05-23T20:43:25.254645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-14T23:53:29.862702Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2410.07073"},"observation_digest":"sha256:412f8fec5d9b3529c4bbac4efe406ae947a04d6a84a704563ea79a9d9d8ef950","observation_id":"b0186bcc-c37c-48bf-856a-0451e49dfe8d","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2501.05465","last_updated":"2026-05-14T16:52:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-03T19:53:57Z","title":"Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)","version":2},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-23T05:47:48.488826Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2501.05465"},"observation_digest":"sha256:5761059e253b88bc43ac3502c5264bbe3aa0963de15b5e1e038c77a228f6537e","observation_id":"ca57eb6a-6339-4196-ac25-3e59ea525085","resolution":{"observed_at":"2026-05-23T05:52:37.581335Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:26af33d32a5581a7716a439fd9f93471cead356b16a73b67364d866746cb9918","observation_id":"d6a8eaea-9549-4d9b-a2f0-5d5f2227275f","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-05-19T08:02:23.002090Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2502.10248"},"observation_digest":"sha256:a02e5746fa19fa1f1e21024c0d5164bab3f6540600553a365f51ec412412e58e","observation_id":"2c8ebcec-b078-4056-813b-4508d264d1df","resolution":{"observed_at":"2026-05-19T08:02:23.537102Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:255430ed59fe0dfde8075f89de96477ce777fab7549c2dbab1148459faa48277","observation_id":"16882dc6-a0b9-46f2-89f8-3a2bbe4acf2b","resolution":{"observed_at":"2026-05-18T00:19:22.173928Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2504.16155","last_updated":"2026-05-07T09:59:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:52:04Z","title":"PRIMETIME : Limits of LLMs in Temporal Primitives","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T18:36:48.376877Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2504.16155"},"observation_digest":"sha256:b06d14bef234156dfb86edadee4545f8e5d228ecb76baab268f92a4cb3385f47","observation_id":"509a881e-5b88-4ba7-a0a5-e4b37d78091d","resolution":{"observed_at":"2026-05-22T18:36:58.695985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2506.12119","last_updated":"2026-05-17T08:18:55Z","snapshot_observed_at":"2026-08-02T23:22:23.397250Z","submitted_at":"2025-06-13T17:59:05Z","title":"Mixture-of-Experts Can Surpass Dense LLMs Under Strictly Equal Resource","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T00:05:08.916339Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2506.12119"},"observation_digest":"sha256:1da2e8e11ded621b3da7d94aeceab8ad5a7d3611db272d1095a25413984d482f","observation_id":"73a841bc-ceb5-48fe-aa7d-35c89d7577a5","resolution":{"observed_at":"2026-05-22T00:05:47.607647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"reference_index":200,"source":"arxiv_source","source_observed_at":"2026-05-19T01:01:09.840919Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2507.00432"},"observation_digest":"sha256:9e28844d42d4a9710e09f878f6cde6965b91645e7325e50cf981468d3ce47489","observation_id":"38d67280-fd08-438e-b4fd-f0f2b2311890","resolution":{"observed_at":"2026-05-19T01:01:10.053215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:f23a7a8be35c4b2b8c88be06ddeb5f0d4c01b4201358d76a90f1bbde6dd281bd","observation_id":"ad27a3f7-0084-4515-b40b-a8492c15271f","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2507.22359","last_updated":"2026-04-14T11:47:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-30T03:50:46Z","title":"League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-19T03:17:06.457421Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2507.22359"},"observation_digest":"sha256:dd5d2e840dff8a4cb1dbaa15abe6c30bfcf04bba15b367dfccb0c72b7f5b46c5","observation_id":"2a5e72e7-5d37-4721-9dd3-7f6e9217b879","resolution":{"observed_at":"2026-05-19T03:22:01.336650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2509.19590","last_updated":"2026-05-16T01:07:51Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T21:29:04Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-21T21:57:55.834632Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2509.19590"},"observation_digest":"sha256:055dd28f25c5e9ea3106bb358a51a51d02167156ba2d577340ff1358facbd337","observation_id":"1ed317f5-0155-49f9-b430-d44a63db8f32","resolution":{"observed_at":"2026-05-21T22:00:41.543036Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2509.22739","last_updated":"2026-05-15T15:16:23Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-25T23:25:47Z","title":"Painless Activation Steering: An Automated, Lightweight Approach for Post-Training Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T21:44:36.351517Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2509.22739"},"observation_digest":"sha256:321eeed4c8fba257fedf2b45bd16c1f1d116f6703353d3e86a977ffeca63e627","observation_id":"5883d43e-d7bb-472c-a274-a212bbdc59ff","resolution":{"observed_at":"2026-05-21T21:45:40.615196Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2510.12773","last_updated":"2026-05-18T21:02:06Z","snapshot_observed_at":"2026-07-06T22:32:37.311210Z","submitted_at":"2025-10-14T17:51:26Z","title":"Dr.LLM: Dynamic Layer Routing in LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T20:01:48.806709Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2510.12773"},"observation_digest":"sha256:f89c403338a7f2fec74637aa75ee2846f14ed02ca95d70a8d31d4a5e733d89cd","observation_id":"88f763f2-ef0f-4d89-af4b-a892cf39b52a","resolution":{"observed_at":"2026-05-21T20:04:20.318861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2511.05501","last_updated":"2026-04-28T16:06:15Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-09-30T21:36:23Z","title":"Towards Real-World Validity in Generative AI Benchmarks: Understanding and Designing Domain-Centered Evaluations for Journalism Practitioners","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T10:59:16.139525Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2511.05501"},"observation_digest":"sha256:298700b212caedbf61a33d5df9a1f08e338226537de0142a87d83e1af78a22a5","observation_id":"d083d6e9-23c5-40ac-9d7e-5de221cd30fd","resolution":{"observed_at":"2026-05-18T11:01:17.080772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2512.14554","last_updated":"2026-04-17T10:30:55Z","snapshot_observed_at":"2026-07-06T22:39:14.117332Z","submitted_at":"2025-12-16T16:28:32Z","title":"VLegal-Bench: Cognitively Grounded Benchmark for Vietnamese Legal Reasoning of Large Language Models","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T21:36:24.376401Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2512.14554"},"observation_digest":"sha256:db1536986b506ec4ef65d210159501074fd2f13510d025eb69dce58b1c3f1272","observation_id":"ba35216e-37b0-419b-8430-b27ba4c611e8","resolution":{"observed_at":"2026-05-16T21:38:34.178169Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-02T19:59:25.953711Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T19:12:24.627033Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2601.08584"},"observation_digest":"sha256:fc6911fa9aea11e652fee60cb0dc0116f4bc9c7e3e99a15c6a0e92b99da661c3","observation_id":"a77233d4-f2aa-48e9-b4e8-4bad0640a905","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-03T03:59:21.087147Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.06371","last_updated":"2026-07-06T11:23:14Z","snapshot_observed_at":"2026-08-03T03:59:18.787479Z","submitted_at":"2026-02-06T03:57:21Z","title":"Bilingual Bias in Large Language Models: A Taiwan Sovereignty Benchmark Study","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T03:59:21.087147Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2602.06371"},"observation_digest":"sha256:12309fadedc17c19c51c4851ef77f76401bd99460507e56bdfe8b86e300dd9a8","observation_id":"3a0c1391-dc27-491e-a871-4bc359d5d02f","resolution":{"observed_at":"2026-08-03T03:59:21.087147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-02T20:36:06.954126Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.22971","last_updated":"2026-05-29T07:44:51Z","snapshot_observed_at":"2026-08-03T00:39:33.801579Z","submitted_at":"2026-02-26T13:08:56Z","title":"SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T20:36:06.954126Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2602.22971"},"observation_digest":"sha256:6dad243b898752460039cb3d3b75c6498843a7b8e6dacbb50e59cae6bb145dc9","observation_id":"d0910937-4558-4948-90de-e21ad3005511","resolution":{"observed_at":"2026-08-02T20:36:06.954126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2604.06377","last_updated":"2026-05-05T18:37:43Z","snapshot_observed_at":"2026-07-06T22:54:53.308309Z","submitted_at":"2026-04-07T19:02:10Z","title":"The Master Key Hypothesis: Unlocking Cross-Model Capability Transfer via Linear Subspace Alignment","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-10T18:36:44.401045Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2604.06377"},"observation_digest":"sha256:162872e4910c603f5acd0e952435cea15b080dfc9f1371b94e5e60985b2305aa","observation_id":"fea78a68-21b2-43a5-a1fe-e961d5eda5a1","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:9ba87ab9c3e7be58b73b07c982b92627d64a5b5e2fef531e73573762554dc4d4","observation_id":"9ca77fdd-8654-4f51-868d-f0caa031e0fe","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:5843de027005f3b0ac33ea75a8df7a520ffd1b0fa293c624f45ce3fc71b48ba1","observation_id":"4dac4e0d-3f34-4c37-95a9-13fc45d49019","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2605.00957","last_updated":"2026-05-01T12:49:13Z","snapshot_observed_at":"2026-08-02T19:05:32.247291Z","submitted_at":"2026-05-01T12:49:13Z","title":"\"I Don't Know\" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-09T18:30:03.367870Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2605.00957"},"observation_digest":"sha256:d8499ad75162e2b76c25f7049b429d96aecdddef966adbae50572ae5c152ce62","observation_id":"58ab0514-50af-41b4-88be-d962e572afc3","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2605.11663","last_updated":"2026-05-12T07:22:50Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:22:50Z","title":"Human-Grounded Multimodal Benchmark with 900K-Scale Aggregated Student Response Distributions from Japan's National Assessment of Academic Ability","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T01:12:44.476894Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2605.11663"},"observation_digest":"sha256:68c6232fb385fc6292905458857dc0d957ae4e8d262310cdeb969d3fb378d790","observation_id":"3d130690-2278-4685-82da-9f183a0feb22","resolution":{"observed_at":"2026-05-16T10:03:59.570579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-13T13:23:25.998584Z","title":"Wanjun Zhong, Siyuan Wang, Duyu Tang, Zenan Xu, Daya Guo, Jiahai Wang, Jian Yin, Ming Zhou, and Nan Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23909","last_updated":"2026-04-03T19:43:24Z","snapshot_observed_at":"2026-07-13T13:23:25.688178Z","submitted_at":"2026-04-03T19:43:24Z","title":"Confidence Calibration in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T13:23:25.998584Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2605.23909"},"observation_digest":"sha256:a799e810cfcee796527e231b6566afcb9775f4c2f3d90aba9e099a40b2a7fe03","observation_id":"572da502-e57c-4723-8c76-364e78efbe62","resolution":{"observed_at":"2026-07-13T13:23:25.998584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-06-28T14:35:48.292081Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:3cdaad3d6fb4a0cff7342045efd8e348af50a8aa01ebae686eca85fe8c7399a0","observation_id":"31646264-be84-400e-a269-aefcba1406d4","resolution":{"observed_at":"2026-07-01T23:16:23.517497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-02T12:41:24.460278Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02780","last_updated":"2026-07-18T16:18:38Z","snapshot_observed_at":"2026-08-02T12:41:17.637289Z","submitted_at":"2026-06-01T18:43:34Z","title":"Do Value Vectors in Deep Layers Need Context from the Residual Stream?","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T12:41:24.460278Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.02780"},"observation_digest":"sha256:685fdafd43060bb6972f7cb32420d0f9c6e94bc00dc9e4b4b0cf1f2d3060e344","observation_id":"9176bcae-832f-49ed-944d-319fa2b21f7f","resolution":{"observed_at":"2026-08-02T12:41:24.460278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.07587","last_updated":"2026-05-27T19:29:01Z","snapshot_observed_at":"2026-07-31T18:45:52.517819Z","submitted_at":"2026-05-27T19:29:01Z","title":"The Routing Plateau: Understanding and Breaking the Accuracy Limits of LLM Routers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-29T14:07:26.366172Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.07587"},"observation_digest":"sha256:58c7640eb3d8a89d4976425898ffb759d6427a475cc0cbb3ed6cedb5b711c889","observation_id":"a23a1af6-d019-4ad3-a5ed-41e18f5a409f","resolution":{"observed_at":"2026-06-29T14:13:30.266780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":245,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:b16ea0adce7ebf41d0a3061098176a48b145b41d1da20307d1ec5297ce1444a1","observation_id":"cc2f04a1-ac84-44b1-a783-a66334d63b63","resolution":{"observed_at":"2026-07-02T22:47:25.972501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-02T12:05:18.407055Z","title":"AGIEval: A human-centric benchmark for evaluating foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":4},"reference_index":247,"source":"pdf_text","source_observed_at":"2026-08-02T12:05:18.407055Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:d590593a362ce54b93eeb48b62e5e322302b7d6f8dcce94db6562e26660ccb88","observation_id":"1aeeb5e2-0e18-4e45-92f0-ee6cf38d01b4","resolution":{"observed_at":"2026-08-02T12:05:18.407055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.22723","last_updated":"2026-06-30T12:58:36Z","snapshot_observed_at":"2026-08-02T20:17:43.316333Z","submitted_at":"2026-06-21T23:45:49Z","title":"BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T09:59:24.703388Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.22723"},"observation_digest":"sha256:73e57e25f821f5a1f02bf751744550ad6c65100349b080c208beffa074b4e5ac","observation_id":"3ddf1b61-ddc0-44ab-9adf-c73eade29cd2","resolution":{"observed_at":"2026-07-04T09:29:43.607054Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.22723","last_updated":"2026-06-30T12:58:36Z","snapshot_observed_at":"2026-08-02T20:17:43.316333Z","submitted_at":"2026-06-21T23:45:49Z","title":"BLUEX v2: Benchmarking LLMs on Open-Ended Questions from Brazilian University Entrance Exams","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T07:04:21.555971Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.22723"},"observation_digest":"sha256:1f81c0240c4a22c55d1acd9d01cc9f0ed53812427c7b60737b2bb5fec4394b6a","observation_id":"bfa5fb53-4e67-4b36-8283-784db1cf8bab","resolution":{"observed_at":"2026-07-01T07:05:28.242446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":2},"reference_index":230,"source":"arxiv_source","source_observed_at":"2026-06-26T09:19:50.623741Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:a11143252a5fe124afde01635011fa5b33ed100b9f8477b95c4f904828a0068f","observation_id":"06aec8e5-42ad-43cd-a44f-86e5557cb9fc","resolution":{"observed_at":"2026-07-04T09:59:44.874337Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":"2304.06364","doi":"10.48550/arxiv.2304.06364","metadata_source":"pith","pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","venue":"cs.CL","work_id":"d42c58d5-eeb0-462a-92ab-3081ee269e59","year":2023},"citing_paper":{"arxiv_id":"2606.22873","last_updated":"2026-06-25T18:44:01Z","snapshot_observed_at":"2026-08-02T23:29:21.699637Z","submitted_at":"2026-06-22T05:37:43Z","title":"SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning","version":3},"reference_index":229,"source":"arxiv_source","source_observed_at":"2026-06-29T01:18:19.195007Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2606.22873"},"observation_digest":"sha256:ceb15eb86ba42d39edcb55d766ea5751d6eb64cc3f325aa1974ad1f10c965c24","observation_id":"0e387e7d-72a1-4955-909c-ca676c74e572","resolution":{"observed_at":"2026-07-01T19:06:02.470889Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"AGIEval: A human-centric benchmark for evaluating foundation models.arXiv preprint arXiv:2304.06364, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-07-12T06:11:37.644287Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:0ded595a1f1d8b940d6c22ba705b33a16fc4792a29fac1254028f0718074da72","observation_id":"b3832bec-1717-443c-92c3-1f82758dfc20","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-01T06:05:51.646144Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models.arXiv preprint arXiv:2304.06364,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22043","last_updated":"2026-07-24T07:13:52Z","snapshot_observed_at":"2026-08-01T06:05:48.156209Z","submitted_at":"2026-07-24T07:13:52Z","title":"Scaling Native Multimodal Pre-Training From Scratch","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:05:51.646144Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2607.22043"},"observation_digest":"sha256:b6bc367bfe82cc60cde918ff30c930d8c0b8d8a7eeed839c90bc6a989161525e","observation_id":"0299e798-3028-48b6-9547-ec7c6453b70c","resolution":{"observed_at":"2026-08-01T06:05:51.646144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2304.06364/citation-record","integrity":"/paper/2304.06364/integrity","json":"/paper/2304.06364/citation-record.json","paper":"/paper/2304.06364"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2022/629","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","venue":null,"work_id":"c4f3637d-3692-46a9-bfea-c7bd6b57ae7f","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e4e87b3809282db7f2a8aa12b64e9c70c2f026c23fa09a8fd68dc8dff418d25b","observation_id":"eceddf27-e116-4dcd-b815-c38f60c9ab3e","resolution":{"observed_at":"2026-05-16T10:03:59.073690Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"c6b78093-c72e-47cb-afc3-1e6df42e13ca","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9afd81d6438198ae94898fb032fc1928afc5da5b19fa13db2f50727204197e77","observation_id":"4827eff9-f0fb-4b93-82b5-8a54479a91d1","resolution":{"observed_at":"2026-05-16T10:03:59.500020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , publisher =","venue":null,"work_id":"ec5f4dd4-c17c-4ada-92fd-e4e521e15710","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e851a3dc285b434c36b0e7544c2465e32e87b9531cf8e19cac3d7426a2133568","observation_id":"49b18a50-e937-4c9f-ba12-bafaa6da526f","resolution":{"observed_at":"2026-05-16T10:03:59.502296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:03:26.304423Z","title":"Communications of the ACM , volume=","venue":null,"work_id":"d5c1eec5-fe7c-47e3-b110-9b2ca7817689","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:f0ac0ffe70ac7cba4ae3f3bd3be6d07d4511b46209996d3cee7455750b695a2f","observation_id":"9cdd79b2-8143-443d-bd91-395de9f7aba4","resolution":{"observed_at":"2026-05-16T10:03:59.504555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"83cfc672-4920-4faa-8e23-5c30b4777e6f","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:bb1a3733bb94bccf59697bd54aa037723e4654366afcdf066d01c4116e6fbd6d","observation_id":"2e3f82e7-0e7e-452b-ab13-456dd0af2239","resolution":{"observed_at":"2026-05-16T10:03:59.507286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:03:26.930364Z","title":"Proceedings of the 2021 ACM conference on fairness, accountability, and transparency , pages=","venue":null,"work_id":"405896f1-2685-4aca-b2cb-8e399a5858b3","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a4c7c6ccd3fc9dd9de91c73278a56c4c472ee137198d42368c7e8a9f0251f8dc","observation_id":"a5976102-e454-45f5-bef5-0209559807c9","resolution":{"observed_at":"2026-05-16T10:03:59.509285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:40.348897Z","title":"and Stoica, Ion and Xing, Eric P","venue":null,"work_id":"cb4b41f6-6d60-4db4-a4d1-6c5bb7899473","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:2a91d71423468b5e83e7d409261856460629fd931adcc7e005a9e647015d1f73","observation_id":"79e3a7cd-34d1-41b2-9b64-cc396f12cdae","resolution":{"observed_at":"2026-05-16T10:03:59.511624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"1dccbab8-e45c-42c4-b225-dd35f1cd8a31","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:27b583767e1149f1528a36c4b9e177f21f8bd237c2b164f82ab1ef805d9ab405","observation_id":"5535508e-df1d-4a78-a604-d68fa1493f2d","resolution":{"observed_at":"2026-05-16T10:03:59.514004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b55f7592-c317-4d05-91f5-cfa499198083","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a391aab93e329fafba6623985955047a473d71fb200f67fc4bdaa91fedf48430","observation_id":"d06274b9-7630-4fc8-8fe0-4804566d947e","resolution":{"observed_at":"2026-05-16T10:03:59.516110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages=","venue":null,"work_id":"75247226-7815-4a7b-b226-02535febf6a9","year":2020},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:0b0d4f18d1ae4d729eda836aab2a00d3167f4bafab0d7a0ce7b638be933571b6","observation_id":"be3ca354-5d71-494c-bc43-6a070579f636","resolution":{"observed_at":"2026-05-16T10:03:59.518118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":"66d37e47-7c9d-459a-a220-e418f67455a4","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:dbe4fccd15a1903c30aecec5392780ce76b7872c88a282e77b1a3398452bc1b4","observation_id":"10aab787-1efa-4875-a11b-5002787a5e8f","resolution":{"observed_at":"2026-05-16T10:03:59.520446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: NAACL 2022 , pages=","venue":null,"work_id":"b2effae6-656c-4eb8-831a-36daf2c75d6e","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9ca3a25e5caad07dcd2947a00a8ef9106cfd5c9624cbb5bdda40fcc7a5d9ae3a","observation_id":"0d52f2b8-57f3-4bf8-b613-295730b44438","resolution":{"observed_at":"2026-05-16T10:03:59.522415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021 , pages=","venue":null,"work_id":"431f3f28-f4d9-46d6-a04f-402025225258","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:0b22b5750702ec692f7d0c1f65ff83bb89a2821c3a577b994742f294c51c54c7","observation_id":"7c539422-9be9-407e-8675-e7109af50f3c","resolution":{"observed_at":"2026-05-16T10:03:59.524430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural Language Processing and Chinese Computing: 8th CCF International Conference, NLPCC 2019, Dunhuang, China, October 9--14, 2019, Proceedings, Part I , pages=","venue":null,"work_id":"ece0060c-125c-4af2-8b6d-027cd5a14a2f","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:df54cfc1a5543e181b49359fdae5414c5c009a6bab9c1fb27f8a99617c8cc958","observation_id":"12608aff-31cb-485d-9b4e-c874ca44d5f0","resolution":{"observed_at":"2026-05-16T10:03:59.526825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume=","venue":null,"work_id":"e7519b01-e7d9-40b0-bfda-8ea336533c32","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:0cc4339bbaf2302d5e0e516b519ea3a2a7f0dedffeeb5f367703e9ce1a364a03","observation_id":"cba04094-6373-4beb-9698-012f02899b02","resolution":{"observed_at":"2026-05-16T10:03:59.529167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Twenty-Ninth International Conference on International Joint Conferences on Artificial Intelligence , pages=","venue":null,"work_id":"eeccd185-d501-4753-98f8-6bb26d80f1c3","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:c41e4a1a9dda443e92eadc2ae5ac9598d63101d0a6a5efe403ffa3243e786ed0","observation_id":"69ae1072-7690-436f-ab93-049159b4b0cc","resolution":{"observed_at":"2026-05-16T10:03:59.531582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sort , volume=","venue":null,"work_id":"88250dec-fc0a-4eaf-b9e5-cf9c803d861a","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:7216345b37c9c2691f52f640d54910534089016daa18ff0c2ea417e3aeafd1e5","observation_id":"462520c3-05d5-427b-8e64-d395cd247bc9","resolution":{"observed_at":"2026-05-16T10:03:59.533715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 55th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"77daf503-1403-486e-97a7-d1a8d7efb8b2","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:846a7420bfc6a7242b4505b240bdd68ecf8dcd49925680768dec22b2dab3bdb5","observation_id":"b720d16e-98a0-4801-a945-97598cce481d","resolution":{"observed_at":"2026-05-16T10:03:59.535952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of AAAI , year=","venue":null,"work_id":"d8d8b301-af9f-4f9a-a9a8-81af534a6219","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e26c21d8d738cf8664efbd2cc3923ebf1192ff1a926586cfb5f9a1bc7682f0d8","observation_id":"5fb47e10-56e5-4c44-8597-50c40d8cc416","resolution":{"observed_at":"2026-05-16T10:03:59.538532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T15:05:03.616349Z","title":"2023 , eprint=","venue":null,"work_id":"aab8e5ca-8400-45a9-a93f-72a6e7d231da","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:402b37fb9dca0d1a16c22fccdde264b04647dc1b1b92f2aa63d3d45201bca3f9","observation_id":"3053355e-a2ac-4da2-8062-f24b2f753da5","resolution":{"observed_at":"2026-05-16T10:03:59.540859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , publisher=","venue":null,"work_id":"d5e72e49-2094-45c4-86d0-6166418f446d","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:da618f58cf6b00fa91164bce1d42d48ef102a85b32159f03fb6a5f72823974fc","observation_id":"82aaeada-ef03-40fd-8be4-3c3468aacd3a","resolution":{"observed_at":"2026-05-16T10:03:59.543220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.834973Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"12f5a236-ef7a-4d13-b4de-b51465a6f977","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:bca4146ab3ceb7ef22d71cffa0d9cce6ece052ebd2f4500caabd3ac415a9673c","observation_id":"9a1b4580-83ea-440c-a13f-f139d49f0e0b","resolution":{"observed_at":"2026-05-16T10:03:59.545617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"427b768b-2ab1-41e9-a7ee-1679a56634bb","year":2016},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:fcee4a047ba4d4246a69fa5bce611c153e79ed0fc25e7524eef903f2598f7d7f","observation_id":"f4235ec8-8e2f-4aa7-a7b0-782de6e941bb","resolution":{"observed_at":"2026-05-16T10:03:59.550600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 44","venue":null,"work_id":"a0b38d87-3973-4f6f-bd55-5a5b1dcf2bcb","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:7ec5d1e02a00f0e6321693b8080534bfe2d1d2abd38e5dfa71b7f9b9846387f0","observation_id":"218d80ba-ae60-4f8a-8b1f-ac5ab851a87a","resolution":{"observed_at":"2026-05-16T10:03:59.553032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T23:10:12.344056Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"65019007-e16d-43db-8c27-29dc3a68efff","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:c281d999562eea3a427aa0e8946b717e34451ae51dcbe361da2ecd00495104ce","observation_id":"913d7210-379c-4fc0-9c98-6ad335545145","resolution":{"observed_at":"2026-05-16T10:03:59.555986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:17:22.153922Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"bd577a47-49ef-4f8a-81ca-86cd88b71479","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:aa3b06d1d9742e90a6dea6f6644c5d0d022d9d84df1dec593884516677551a34","observation_id":"7ec90262-7d23-4b5b-9803-b25d309f2201","resolution":{"observed_at":"2026-05-16T10:03:59.558766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference on Empirical Methods in Natural Language Processing , year=","venue":null,"work_id":"63aa4acd-b431-4761-b910-b16832337616","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a7281f5d5bdcd7c180dd455e335ec5ba5bfd2ad9e8002f6b97580561170a76c2","observation_id":"1598b0a2-3d28-47b5-baa4-6946bcaf02be","resolution":{"observed_at":"2026-05-16T10:03:59.561172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Available at SSRN , year=","venue":null,"work_id":"ddba4838-4c0a-4f7b-a584-4acb6810de1f","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:0158285b5ed319d42ecddaf23f4c6d4d31099b0fbea5b5a17c6a7da52b5ddc04","observation_id":"5f51fdd2-55ab-46d8-a328-85303efbe9bb","resolution":{"observed_at":"2026-05-16T10:03:59.563201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"c69e4d8e-ef0d-4917-9a54-8af14038aec1","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:43a41b31256eea652d1a24accc937b3fe3f696acefa0c8b58542d474be29f7b4","observation_id":"b69fc3a0-1349-4b6b-81c7-acf67b5ccbf8","resolution":{"observed_at":"2026-05-16T10:03:59.565636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Open llm leaderboard","venue":null,"work_id":"19a27495-471f-47f4-b821-9c7e662589af","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:2b5cc494979a02e6b79b7b16497110ba2276e5bb5d41ac0e6fbddf4dcc962083","observation_id":"5d3c9655-3c2c-4664-9efe-e4c9171ba505","resolution":{"observed_at":"2026-05-16T10:03:59.567594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d15-1075","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T19:17:17.500921Z","title":"Bowman, Gabor Angeli, Christopher Potts, and Christopher D","venue":null,"work_id":"f993835a-6146-425a-8004-05fce2ed6ad6","year":2015},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9635548a4ae45a5ff3f466d7d3902e12c9a122c403ff7f549eac3a0348982579","observation_id":"f6b526fd-9ac2-4c98-9334-45eab891f8cb","resolution":{"observed_at":"2026-05-16T10:03:59.079975Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-12T06:49:23.747514+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T06:49:23.747514+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are few-shot learners","venue":null,"work_id":"b5af3a68-2622-4421-b39b-b1d2fbde2d8d","year":1901},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:c8176e654717e46dd5126d1276f8aef698236180dd9f59a41746452392f5a254","observation_id":"691af668-411c-430d-862d-bd1c621472ab","resolution":{"observed_at":"2026-05-16T10:10:50.745209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":"2303.12712","doi":"10.48550/arxiv.2303.12712","metadata_source":"pith","pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","venue":"cs.CL","work_id":"a23cfe92-7f7c-424b-98d4-b386a83002fb","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:dd5a5f2703690fb7eb2a6a01dac7ab0555ed8677ca299ae1f24e526fd02aca8b","observation_id":"993a77f4-6bee-4aa9-9627-254650120217","resolution":{"observed_at":"2026-05-16T10:03:59.375746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"fc02f9f4-cc6e-40b8-89c3-6214feb7c9cc","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:2a07623a0c6d8f22743117bc09e986f1cc8b83415aa46c88ff6c21aa277782a8","observation_id":"b48e4779-0801-4903-a479-770cb5d1cfa4","resolution":{"observed_at":"2026-05-16T10:10:50.738102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt goes to law school","venue":null,"work_id":"7badf984-3571-4ec2-9bfa-ab600af0bfa7","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:7c6b2c1ed1e7883460886e578263d67da60941e4f17fdbf360f7f394110ee172","observation_id":"f24f9ad8-ec22-4202-87ae-48da610e86b4","resolution":{"observed_at":"2026-05-16T10:10:50.749863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":"2210.11416","doi":"10.48550/arxiv.2210.11416","metadata_source":"pith","pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Scaling Instruction-Finetuned Language Models","venue":"cs.LG","work_id":"8405abb1-7558-4fdf-af24-f4c52fa77a06","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e7b35ca45e49f3f6f600e2ce77684c9ce6acc99d9ad0c032a6b00fb18a537708","observation_id":"5f8f8b8b-7ecd-48e8-b82e-c32b3448bb82","resolution":{"observed_at":"2026-05-16T10:03:59.379161Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":"1905.10044","doi":"10.48550/arxiv.1905.10044","metadata_source":"pith","pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":"cs.CL","work_id":"511eeb84-4b95-46d5-b14f-50da43f4f19f","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:5ba1b571ad8b35ea42fc735784bab2d950ec3f9c98db3f2b922db6d7df772892","observation_id":"1b303851-ad7f-403c-8d98-99f0d9f4fc6b","resolution":{"observed_at":"2026-05-16T10:03:59.405898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S ent E val: An evaluation toolkit for universal sentence representations","venue":null,"work_id":"492c0d31-3bed-4a55-a208-1d3f6d410ee9","year":2018},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:d0cb9bc62b28c24b4c7fd76055f7fb89d6759792eec0e1765320d357c96ead4d","observation_id":"bf54d8b5-bc7b-4a6f-9f4b-0fb30d85ed55","resolution":{"observed_at":"2026-05-16T10:10:50.732390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1423","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:27:44.847366Z","title":"BERT : Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"Proceedings of the 2019 Conference of the North","work_id":"3e3c8ac8-b858-4b22-af32-393d98c883e0","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:691a9474c4c1c4a34303b64c67dac595d04526d8e86b4dcc3803ca999874212a","observation_id":"33bc5809-39b6-4c1d-96f3-70b2dfa37f58","resolution":{"observed_at":"2026-05-16T10:03:59.083891Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T13:38:13.85894+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T13:38:13.85894+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bold: Dataset and metrics for measuring biases in open-ended language generation","venue":null,"work_id":"e8827dcb-7649-4fdd-b0ed-b5355485d230","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:7a81fea99e1f587fc48092112fb5a6f7219c827c0c78b00fe6ee5a3130b6aff2","observation_id":"a93b10d7-3fa4-4c49-9261-d467bef46773","resolution":{"observed_at":"2026-05-16T10:10:50.752424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":"0351ed70-84d4-4f9d-8100-239a3f780c09","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:0e4203a2f38c2ad2e18eb7e9c66fed77174ba325f7dd613874a22a3ada1d02ad","observation_id":"2a877411-e333-49a6-b87c-17c3ec2397e9","resolution":{"observed_at":"2026-05-16T10:10:50.754871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-99739-7_44","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T04:53:05.868464Z","title":"Introducing the HIPE 2022 Shared Task:Named Entity Recognition and Linking in Multilingual Historical Documents","venue":null,"work_id":"34f09e5a-1327-4459-af50-c918b55c1139","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9a9692d517e1e4bd527a8c36b0ffa72d05b94796d7faaa01dca113ca3999731c","observation_id":"74321b76-3ab6-4a94-aa01-2c563ab54fc0","resolution":{"observed_at":"2026-05-16T10:03:59.087485Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09509","last_updated":"2022-07-14T13:04:29Z","snapshot_observed_at":"2026-07-06T12:49:18.486644Z","submitted_at":"2022-03-17T17:57:56Z","title":"ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection","version":4},"cited_work":{"arxiv_id":"2203.09509","doi":"10.48550/arxiv.2203.09509","metadata_source":"arxiv_reference","pith_arxiv_id":"2203.09509","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":"95f55841-a485-4590-97e6-e1655f9ea11e","year":2026},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2203.09509","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a0d39b2e2e78a48a17ce32b3bb92cccdfd062203c2e1994f38f695edbe8ec52e","observation_id":"17fef00c-fb8a-49b0-8274-5f2caa630e97","resolution":{"observed_at":"2026-05-16T10:03:59.401936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"6d80e23e-6da4-4b01-8cad-df8701202285","year":null},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a38b7eca54cc0b1720b7e3c35b249f6f0ee0446fd6a84300df40a806901ed718","observation_id":"5ef4eacd-2452-4ba7-9353-6ff6c347e65f","resolution":{"observed_at":"2026-05-16T10:10:50.709419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:25661cea6ea0937d41c298987a9b73e6ef6fba2123a8a3e531d691ce2720aceb","observation_id":"bf17a0e3-d25e-4d47-a60b-66fa52e7268b","resolution":{"observed_at":"2026-05-16T10:03:59.361824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_00276","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:14.494802Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":"Transactions of the Association for Computational Linguistics","work_id":"45551929-96dc-40f3-9f89-10e76731cc24","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:6036e37c4103359f19d77d5c56c65eb9b943c6ae7ff610a1459ed94c24b804a1","observation_id":"11fd4998-b610-4a65-b24d-36b34abf0ca1","resolution":{"observed_at":"2026-05-16T10:03:59.090511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-10T22:21:01.890529+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T22:21:01.890529+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T04:45:59.166613Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":"3f96113a-7be7-48f4-983e-ca568eb29767","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:359a3106bdac1ad8aaeb43a7526dd690b0c3c3f07109049511e3d0a8d3d4079d","observation_id":"7436fb72-2b7d-4a81-9515-a5c7e6526867","resolution":{"observed_at":"2026-05-16T10:10:50.718709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:4b79df65b611df4363136257faf68b70387a1a4731fd6d360c7bbb0dd350a90a","observation_id":"71fd7756-0d77-4e79-98c8-079e786055e0","resolution":{"observed_at":"2026-05-16T10:03:59.393937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Program induction by rationale generation: Learning to solve and explain algebraic word problems","venue":null,"work_id":"440d7af0-092b-46d2-837f-8053ab609b1d","year":2017},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:3718636095d42d4f50b92555f5632e8d524ca09f21976b14e76ac57250ad32fa","observation_id":"5afb741b-c594-49c9-b21f-5d1f3cd3f1de","resolution":{"observed_at":"2026-05-16T10:10:50.716622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning","venue":null,"work_id":"c4c1e80b-ff50-4440-b74e-4128df6ed5be","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:35ae9a5a7b36f23bf92dc6e154ba6664bd28a478650c7eeeb1a2e879a9e9b2ef","observation_id":"492a83d3-6c7b-4d4d-abe2-073dc79102e7","resolution":{"observed_at":"2026-05-16T10:10:50.742853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rebooting AI: Building artificial intelligence we can trust","venue":null,"work_id":"b29fb8be-6613-4205-a72a-23b72e82cb7f","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:035a009d55516fac6a69cc3c99c5bdf13b4a6e615473d8d1184baa314a411743","observation_id":"8cc1fb61-b6e1-44a5-af57-97a2d314fdca","resolution":{"observed_at":"2026-05-16T10:10:50.706679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08730","last_updated":"2018-06-20T16:39:26Z","snapshot_observed_at":"2026-07-06T06:46:18.285019Z","submitted_at":"2018-06-20T16:39:26Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","version":1},"cited_work":{"arxiv_id":"1806.08730","doi":"10.2466/pr0.1957.3.3.635","metadata_source":"pith","pith_arxiv_id":"1806.08730","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","venue":"cs.CL","work_id":"75b95963-bb63-4588-816d-17e4bf36092e","year":2018},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/1806.08730","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:14ce9e1d11ae4849b1468c1a96e4c4af136c021af3a1d776510a181b5b491b60","observation_id":"74af0108-3cd6-40ce-b897-eaeba7dceb9f","resolution":{"observed_at":"2026-05-16T10:03:59.370251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"b8eaea64-55b6-4536-af8b-801a96bdcdd6","year":2018},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:bd34d99ffe5ea933d7ecdf25b024a81b529d1ae2d5418fca0db96cfaa12e0825","observation_id":"06e8bd09-ba43-41ea-a2c2-61486f56a500","resolution":{"observed_at":"2026-05-16T10:10:50.747617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:26:54.787661Z","title":"Gpt-4 technical report","venue":null,"work_id":"388f534c-855a-4366-b933-f07bf3e2db5f","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:92b895eef640972a47893c4557279d7443e9aa80c1914e31bc66dec1cda837cd","observation_id":"d1ac8ec6-ae06-4a8b-904c-f91c8b6cb2e4","resolution":{"observed_at":"2026-05-16T10:10:50.740482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"419d5fd7-fcec-439f-b29a-d31dcb6533dc","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:d7adabaa6f5327c3dc7126b810b8b2f6679a73a040646d2be2cf3da336567cd1","observation_id":"6151d5f0-9bb4-4d86-98e9-fc7ff67c8c8f","resolution":{"observed_at":"2026-05-16T10:10:50.720716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06031","last_updated":"2016-06-20T09:37:17Z","snapshot_observed_at":"2026-07-06T05:00:33.838934Z","submitted_at":"2016-06-20T09:37:17Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","version":1},"cited_work":{"arxiv_id":"1606.06031","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.06031","snapshot_observed_at":"2026-07-10T15:27:20.134743Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":"cs.CL","work_id":"3775e6d1-2f28-4791-82a9-538c0507512c","year":2016},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/1606.06031","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a85642d07cdfb3a0fab5c5c4a10f68db7a5b9281e855be1030fe96ebe7eb238f","observation_id":"0b9a2912-9140-4006-8969-ab5871388564","resolution":{"observed_at":"2026-05-16T10:03:59.397681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":"d724cfdc-22fa-4dc9-a0ca-616af70e7344","year":2016},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:5b218f282e6f89b6b642ab053ce7c3d77657ceb1cb8600f5e1667a15041d8f3d","observation_id":"ab8fe06f-5254-42fe-9281-58575fc4fade","resolution":{"observed_at":"2026-05-16T10:10:50.724507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internlm","venue":null,"work_id":"98da4e90-7be4-4022-8a56-2a89fa5e16a9","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:736ede3bd7006cad11673c0dba6e9c2c924a2fabbc5097988879bda7f2a5a2c3","observation_id":"18d8e589-4ddc-4a2d-b85d-e354f30e5b7e","resolution":{"observed_at":"2026-05-16T10:10:50.735794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05355","last_updated":"2018-12-18T10:58:20Z","snapshot_observed_at":"2026-07-06T06:28:16.475418Z","submitted_at":"2018-03-14T15:30:37Z","title":"FEVER: a large-scale dataset for Fact Extraction and VERification","version":3},"cited_work":{"arxiv_id":"1803.05355","doi":"10.18653/v1/n18-1074","metadata_source":"pith","pith_arxiv_id":"1803.05355","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"FEVER: a large-scale dataset for Fact Extraction and VERification","venue":"cs.CL","work_id":"b696f75f-e5ad-4555-9c12-e292e77c388f","year":2018},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/1803.05355","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:505603f66553ff1099df9ee9bfc0a7201053cda2883587b5ee0d5c7cd0cb4b58","observation_id":"d2e3e2d2-394f-4046-b05f-bd1c02611323","resolution":{"observed_at":"2026-05-16T10:03:59.094484Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:19.296232+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:19.296232+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-11T03:47:48.508181Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:2b34cf05c31d5604c3787a9322a0aa140e58652c0997bf68af82172c571f8bdd","observation_id":"9bf6514a-5cf1-4f39-86fb-05d3c8f08353","resolution":{"observed_at":"2026-05-16T10:03:59.366393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w18-5446","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:57:06.760757Z","title":"Proceedings of the 2018","venue":null,"work_id":"24f74631-3b99-4e7e-ab15-b562e791542e","year":2018},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:1f7870f6b1151ab1abd9d5f720bd3530a0b4ae7bf6a89cc6e5b92e7d333c45c3","observation_id":"12435b9b-5f55-49a2-9727-4ae09c88d1a1","resolution":{"observed_at":"2026-05-16T10:03:59.098487Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-09T07:48:42.118348+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T07:48:42.118348+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Superglue: A stickier benchmark for general-purpose language understanding systems","venue":null,"work_id":"c7c6a678-b242-4b6d-84eb-34cf968f0861","year":2019},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:1cd612e82b972e57388b6c56f1bfa82fd27479f6be1f4df8340bf1460d47391e","observation_id":"3f086877-2f1e-44f2-91cd-ee86bbf2cd0e","resolution":{"observed_at":"2026-05-16T10:10:50.757529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From lsat: The progress and challenges of complex reasoning","venue":null,"work_id":"7c06fcbf-f728-4148-9c43-b03a0c8fe44a","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:44910b97edbfe5a00fd2e99473302f36454f8d4f033231c76dc7133219c8dfe5","observation_id":"a9d818a3-b884-4b38-bfef-3b7826380d7d","resolution":{"observed_at":"2026-05-16T10:10:50.727175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:4e2b7c2c26d2bfd2011809fd019e08d2dc9024fa2954ebd1ee81db7e3ba1ab98","observation_id":"e7e0ed83-3f32-4c6c-b3f2-afe2dbd938ee","resolution":{"observed_at":"2026-05-16T10:03:59.382955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.391775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:79a658419e2961eecbbe31b79d5b64b3792c98689e8bb830a7f9bdfd3e479364","observation_id":"bcf85aca-e9c9-490c-a91b-5ee4cc34586a","resolution":{"observed_at":"2026-05-16T10:03:59.386291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03493","last_updated":"2022-10-07T12:28:21Z","snapshot_observed_at":"2026-07-06T14:01:50.333970Z","submitted_at":"2022-10-07T12:28:21Z","title":"Automatic Chain of Thought Prompting in Large Language Models","version":1},"cited_work":{"arxiv_id":"2210.03493","doi":"10.48550/arxiv.2210.03493","metadata_source":"pith","pith_arxiv_id":"2210.03493","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Automatic Chain of Thought Prompting in Large Language Models","venue":"cs.CL","work_id":"c3739d30-4ba4-47ca-a8c7-41daf3b51e71","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2210.03493","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:aee4e3b32a203d9ab7e4fd1e8a8791cd04d450f348768a27906bc97bda4ea1af","observation_id":"4c12a26a-adaf-41eb-9701-0e88483c06e6","resolution":{"observed_at":"2026-05-16T10:39:17.100641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jec-qa: A legal-domain question answering dataset","venue":null,"work_id":"5b3e49f0-3ed5-475c-95bd-35d9a825c728","year":2020},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:4bfb358fb684a0b1820d05fedfb4e810cf9426ced4a8f589b20e4263ad0b3b43","observation_id":"3a2a199e-9a60-4dc3-8da9-f61c1846653d","resolution":{"observed_at":"2026-05-16T10:10:50.729592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-naacl.177","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analytical reasoning of text","venue":null,"work_id":"93eda4fa-ebc3-47d0-9d20-40508ed6b284","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:d145f0575844cdc56fb89374cefcc1dab1bab79ccc235d4c95ac6486054e4a0c","observation_id":"bd69c749-c915-49a7-b05f-c5c109380e87","resolution":{"observed_at":"2026-05-16T10:03:59.101368Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ddb9edcf-4079-43b8-b2a7-6aa2499015a2","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:6977e5d534a3354def5e77e0f4ece8599b3dc7c6dd0a3b4a7b4240542d78ae10","observation_id":"03fa877b-326b-4c22-ba46-2fae0045a960","resolution":{"observed_at":"2026-05-16T10:10:50.714389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploiting Auxiliary Data for Offensive Language Detection with Bidirectional Transformers","venue":null,"work_id":"eeb4200c-c613-4812-a853-682b27fcded7","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:c74e23c904084cf22d6694d95cf6f1dd0a5088329135b0407efdd48027515ee1","observation_id":"ab3b8154-9675-4642-a5bf-c6c1aa7d393b","resolution":{"observed_at":"2026-05-16T10:03:59.104165Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling Profanity and Hate Speech in Social Media with Semantic Subspaces","venue":null,"work_id":"7be92b5a-4cf6-4b51-a9aa-7ea564911747","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:27e0a2d129fbc23ef422dd8ecf1301fa340c620967c2dbc3f3db5be734c898a7","observation_id":"a4e67bf9-8441-4a5a-a2ec-0fa2fd704679","resolution":{"observed_at":"2026-05-16T10:03:59.107151Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T06:41:42.840172Z","title":"H ate BERT : Retraining BERT for Abusive Language Detection in E nglish","venue":null,"work_id":"2bcfea56-618e-4a3e-b76f-d2eb12b37f92","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9cda7cf49af29bd4fdd7622ba0aab50ce671c61ff4f113b991e787606ab09d61","observation_id":"032ef19b-7e0b-4b5e-8f6a-c1fd2dc0406c","resolution":{"observed_at":"2026-05-16T10:03:59.110275Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memes in the Wild: Assessing the Generalizability of the Hateful Memes Challenge Dataset","venue":null,"work_id":"85e5ceb8-2da3-4f50-a3ac-5beb11669514","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e3b6937023a6fecab31f6dd7a60e3c6a76eaec7a6028b865cff77d8c341b4ec3","observation_id":"6bbb9fed-d274-4707-9a09-a45bd33f599e","resolution":{"observed_at":"2026-05-16T10:03:59.113286Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.5","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring and Improving Model-Moderator Collaboration using Uncertainty Estimation","venue":null,"work_id":"f13f32e3-8387-4dfc-907e-8b3348477a03","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:9619c0f23e7b9998dd1e59c07f39bbee0f5852dd6b22d5fcf363e6ea445d92ba","observation_id":"d4658c11-1b9c-47d1-9f33-2e05499b2b5a","resolution":{"observed_at":"2026-05-16T10:03:59.115917Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DALC : the D utch Abusive Language Corpus","venue":null,"work_id":"28f46b28-1868-4389-8a45-ac87d4dc737a","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:a7c84f4305f1e9c315c9a4b4f6fa2444228b31f0032e57cf942c01aba69ba44b","observation_id":"830f09bf-d889-4895-8a9c-7c83090d472f","resolution":{"observed_at":"2026-05-16T10:03:59.118550Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Dulal, Saurab and Koirala, Diwa","venue":null,"work_id":"ac94ecbb-0583-44e6-b63a-2893b6607e43","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:8327f385575528bc3a41ca80acb9319d90fa53d19b37620223177f98a7c31c1b","observation_id":"90eceacf-ec56-47d7-af81-ce4bb74805ec","resolution":{"observed_at":"2026-05-16T10:03:59.120857Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MIN \\_ PT : An E uropean P ortuguese Lexicon for Minorities Related Terms","venue":null,"work_id":"5e3ca891-2567-429d-a730-004663388070","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e71b748a15ca621359e101174ebc4671ec8a3a76f3cfedc92c1627c242ae726d","observation_id":"f8d4ca18-85fa-477f-8b1e-992095f15976","resolution":{"observed_at":"2026-05-16T10:03:59.123500Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.9","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-Grained Fairness Analysis of Abusive Language Detection Systems with C heck L ist","venue":null,"work_id":"295e6de6-faaf-4267-898f-799eb0c302d5","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:8e2feb13cc44623648fca0912b28f815e49ec522076b4aacbbaf163acc704f2d","observation_id":"87f1d437-2827-454e-aa09-01332a2b4b52","resolution":{"observed_at":"2026-05-16T10:03:59.126081Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.10","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving Counterfactual Generation for Fair Hate Speech Detection","venue":null,"work_id":"a28757eb-a713-464b-8e0f-11004bdd66a9","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:26e80b5665ccdc1d7b0d9adc75999940486c001c8096a4155aa619203eac7f2d","observation_id":"a438ce5e-44e9-4f87-9313-281e8e6291ff","resolution":{"observed_at":"2026-05-16T10:03:59.129146Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.11","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hell Hath No Fury? Correcting Bias in the NRC Emotion Lexicon","venue":null,"work_id":"5fbe5476-661c-43c8-afab-9bcc52ee081f","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:5e0ad243bcafdb7336d9dc17d159488b85bf490662c8794d927cc7b43977b4cc","observation_id":"9a4de569-3b17-4519-9810-27d09fea88bf","resolution":{"observed_at":"2026-05-16T10:03:59.131534Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.12","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating Biases in Toxic Language Detection through Invariant Rationalization","venue":null,"work_id":"fe68a33d-9a74-4b41-b915-d4852ee58232","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:2675fdaf4d493b3c2f1df981bba293ccc1afdf4afb22698c7da9b13b73ce00a8","observation_id":"96de1339-8b1d-4989-a1de-8005801b0fae","resolution":{"observed_at":"2026-05-16T10:03:59.134410Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.13","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained Classification of Political Bias in G erman News: A Data Set and Initial Experiments","venue":null,"work_id":"ac00abdc-0442-40dc-8247-7c20c48eae7f","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:7e71f69090c7b1318210bdad2fd50acd9cf697e5e874cd33aa789dfdc172d315","observation_id":"c8ae52ef-7779-42a0-812d-a3f4844cfe7a","resolution":{"observed_at":"2026-05-16T10:03:59.136789Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.14","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jibes & Delights: A Dataset of Targeted Insults and Compliments to Tackle Online Abuse","venue":null,"work_id":"44f51734-8e9c-4005-82ef-407c4f427b13","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:6d09366f7fc2c5b7849d7ae308793cead94798eac36bad0755bb8be9a8a5b5e6","observation_id":"274c958d-26ad-434c-9fe7-e55115ea91aa","resolution":{"observed_at":"2026-05-16T10:03:59.139242Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.15","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Context Sensitivity Estimation in Toxicity Detection","venue":null,"work_id":"af417af1-aa26-4f73-9a3b-6cb2bbf278e0","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:035cde186b5f0f372375008da318a70f5270af1e13f2e2a737c64a8f31823841","observation_id":"bb2f7b6f-5349-4428-9352-f12a84e9a4bb","resolution":{"observed_at":"2026-05-16T10:03:59.141516Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.16","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A Large-Scale E nglish Multi-Label T witter Dataset for Cyberbullying and Online Abuse Detection","venue":null,"work_id":"1e712c25-3606-4c0d-bedc-6050602f63af","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:06a965a78fa87b01ebaa497c054d173a8158cf5a385ad711b1e020df4949140c","observation_id":"b9199c39-3889-4e5a-bb1c-95885278251a","resolution":{"observed_at":"2026-05-16T10:03:59.144558Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.17","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data Integration for Toxic Comment Classification: Making More Than 40 Datasets Easily Accessible in One Unified Format","venue":null,"work_id":"7adbf7eb-4982-4284-8167-e359efc8b35e","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:8f0e17d414863a3d773f6cffdf4d8f96856d9164f57bf9cb895961bc471cda84","observation_id":"65c9bad9-4fa3-416c-bb00-4ecc618df2f4","resolution":{"observed_at":"2026-05-16T10:03:59.147830Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.18","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and H \\'e bert-Dufresne, Laurent and Roth, Allison M","venue":null,"work_id":"ce6faf7e-3687-41b5-9556-8ea1c79ab249","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:ed6a58d2e8127ae4cbba6143af1e2c5f6d5a26ceb206951afd32438c0667d96a","observation_id":"f5cc10fd-b4ab-415c-85b1-fee0ab1328fb","resolution":{"observed_at":"2026-05-16T10:03:59.150099Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.19","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Targets and Aspects in Social Media Hate Speech","venue":null,"work_id":"3b3827ef-5506-488e-afaa-98580ce16022","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:c06b72d1aaddd46d903ed19057553a1070041b5dfa3c314d1f5526d80dd3cbf5","observation_id":"223e06c0-2ce6-44c5-899f-22a22fd1efce","resolution":{"observed_at":"2026-05-16T10:03:59.152182Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.20","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abusive Language on Social Media Through the Legal Looking Glass","venue":null,"work_id":"4f976912-fa42-4b6e-b5b1-5389d624980f","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:277b94b0875aacb25317dde4a1e498f0e41f6dd9c989caf32d2528b6fa8ebeb1","observation_id":"68ce1835-4606-4bb5-b487-31f1d36ecf11","resolution":{"observed_at":"2026-05-16T10:03:59.154771Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.21","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:12:18.698116Z","title":"Findings of the WOAH 5 Shared Task on Fine Grained Hateful Memes Detection","venue":null,"work_id":"fc04beac-3f4f-448e-8fc0-436981aa6158","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:1d5c6489a0c5393001ced3ec16310ed39f177a8dc966e0124f616c144776947b","observation_id":"fec804b5-2b12-44b5-a068-c28e9f61b2fa","resolution":{"observed_at":"2026-05-16T10:03:59.156983Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.22","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VL - BERT +: Detecting Protected Groups in Hateful Multimodal Memes","venue":null,"work_id":"8d650500-f8e9-443c-b641-add177619892","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:685395faef5bf364f75b88b13577d9a445b776f79ec129aa34e51d2b24b02b60","observation_id":"b72c17f0-1090-4f73-be34-172e5f03780a","resolution":{"observed_at":"2026-05-16T10:03:59.159625Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.23","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T07:45:28.816337Z","title":"Racist or Sexist Meme? Classifying Memes beyond Hateful","venue":null,"work_id":"7008cada-ada9-4a0b-8a08-82539dada914","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:55a5f938b91b26a9e89c2f7d92499652830cbb5fdbbb1a98ac5b24e77abc7d89","observation_id":"a5ee5f4c-bd93-4234-aefa-7c4278cb278d","resolution":{"observed_at":"2026-05-16T10:03:59.161674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.woah-1.24","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal or Text? Retrieval or BERT ? Benchmarking Classifiers for the Shared Task on Hateful Memes","venue":null,"work_id":"c7b85d5f-88f5-4361-b826-76b5eeb29c03","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e267d7c2ace8f99d0cf16072cd4b9e6705f604960241c954988175c974452e83","observation_id":"470c38d8-3f6f-48ca-a061-7f05031e48aa","resolution":{"observed_at":"2026-05-16T10:03:59.163828Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce810724-ec45-4586-ba26-4ef08039577c","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:1c26f6d2d4440622ca8e1ae3e27b04db6e479b343d71209bd619c4f979433061","observation_id":"e3570e05-a656-4a15-af58-58cb564b2b72","resolution":{"observed_at":"2026-05-16T10:10:50.759798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text Simplification for Comprehension-based Question-Answering","venue":null,"work_id":"a3002415-5c2c-4df1-acee-44cb0c9dec5f","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:d93cd680af92c58ced94b831004451698933ac9bcfcf3880bfc8092ad0063b71","observation_id":"bca6162d-039b-4d9c-8041-29ee21286cbd","resolution":{"observed_at":"2026-05-16T10:03:59.165782Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Finding the needle in a haystack: Extraction of Informative COVID -19 D anish Tweets","venue":null,"work_id":"84e0be46-b5e6-424f-818f-fce496d04588","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:f3a6e847dadb18f2bc0be3b4f4267c2cde2f09bc9d7645395579a2be4271a438","observation_id":"18b935fb-76c2-44c0-a730-b029aef26efc","resolution":{"observed_at":"2026-05-16T10:03:59.167986Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Detecting Depression in T hai Blog Posts: a Dataset and a Baseline","venue":null,"work_id":"4ceb3867-f3ee-4abe-9870-465e6f61b9ca","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:65330554091a68d2d55249315dd014774921740e57ca497f7b988eef1b6e8cc5","observation_id":"6cb98123-eb58-467c-9357-e1cb0cb67d68","resolution":{"observed_at":"2026-05-16T10:03:59.170033Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Keyphrase Extraction with Incomplete Annotated Training Data","venue":null,"work_id":"629bbbb9-f908-4ac8-91b0-255233d8d34c","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:49be097f88a542e8fcb0603f6800e2b86714ff883c30ab24eb5237c589439edb","observation_id":"26398b59-dc55-4a42-be27-20a95b9237b4","resolution":{"observed_at":"2026-05-16T10:03:59.172227Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.5","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained Temporal Relation Extraction with Ordered-Neuron LSTM and Graph Convolutional Networks","venue":null,"work_id":"c49a540a-b7c5-400d-b94b-140b66cc595c","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:f0edd0d691f1baf56e95f9e96a33045e5e7b44a6879dbb4ba279b1bc9d6a7a06","observation_id":"0d4bef67-af6d-4ce4-89ed-a86e3e0666c7","resolution":{"observed_at":"2026-05-16T10:03:59.174264Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.wnut-1.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Does It Happen? Multi-hop Path Structures for Event Factuality Prediction with Graph Transformer Networks","venue":null,"work_id":"f90f8776-74a3-42a6-80f2-8804b5504947","year":2021},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:e3ac2bcc3a2de132eb0407f2d3762eb789af0b51c40d89c913e6347a49c10927","observation_id":"5c5c900f-130c-4450-a8d0-0ee8507ac09b","resolution":{"observed_at":"2026-05-16T10:03:59.176580Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-02T06:30:47.504484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":49,"verified_fuzzy":47},"total_outbound_references":287},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 3 August 2026, this Paper Citation Record lists 100 of 287 outbound references and 55 inbound Pith citation observations for arXiv:2304.06364."}