{"as_of":"2026-08-04T17:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df2a6b48fa8d24cc30cd3fa4ad4aaa9a44a24b79188fca77ddc981b540a726ee","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T18:41:34.878542Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:59:49.787962Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19276","snapshot_observed_at":"2026-08-01T01:59:49.787962Z","title":"Memory decoder: A pretrained, plug-and-play memory for large language models.Advances in Neural Information Processing Systems, 38:115487–115510, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25614","last_updated":"2026-07-28T11:45:34Z","snapshot_observed_at":"2026-08-04T00:06:42.832855Z","submitted_at":"2026-07-28T11:45:34Z","title":"MemSFT: Mitigating Alignment Tax with an External Parametric Memory","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T01:59:49.787962Z"},"links":{"cited_paper":"/paper/2605.19276","citing_paper":"/paper/2607.25614"},"observation_digest":"sha256:43caf4d21ce9f4553cb63901f859245075c6f3ee260cbd3ae0af51067ca4aa4a","observation_id":"d9c2fd53-3dc8-4f36-93bc-8a52f7067c9a","resolution":{"observed_at":"2026-08-01T01:59:49.787962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.19276/citation-record","integrity":"/paper/2605.19276/integrity","json":"/paper/2605.19276/citation-record.json","paper":"/paper/2605.19276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.841449Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"ffe51955-969e-4a51-bd04-3fca1c9ae208","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:e37476a28777f5b8f751e8a3993f25fdbad49f505b31b4e6066a415241e99bab","observation_id":"d592d2f6-3689-4cd5-a00e-b686cf03132e","resolution":{"observed_at":"2026-07-08T03:34:32.842784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04604","last_updated":"2025-01-08T05:24:50Z","snapshot_observed_at":"2026-08-04T14:31:04.378756Z","submitted_at":"2024-12-05T20:40:28Z","title":"ARC Prize 2024: Technical Report","version":2},"cited_work":{"arxiv_id":"2412.04604","doi":"10.48550/arxiv.2412.04604","metadata_source":"pith","pith_arxiv_id":"2412.04604","snapshot_observed_at":"2026-07-10T21:57:38.012130Z","title":"Arc prize 2024: Technical report","venue":"cs.AI","work_id":"49bd7afe-e99e-4c34-8417-36562ab6cd8d","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2412.04604","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:003ce4ec0de3abfe73c2527de0a0a25da160aa39db2ab71673de0983a55cc3b2","observation_id":"71843c89-91ee-46e1-b745-5a7c8035d78a","resolution":{"observed_at":"2026-06-30T18:45:00.502117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.839549Z","title":"Lmdeploy: A toolkit for compressing, deploying, and serving llm.https: //github.com/InternLM/lmdeploy","venue":null,"work_id":"1f1ab9d3-d1c8-4c88-b0a8-5ba827329652","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:3fb7d46be920ba422b226da076eff5589d3d3617af3c19b111f4c43ed58c3659","observation_id":"75a1b657-6649-4020-9ce1-65c629aeccc8","resolution":{"observed_at":"2026-07-08T03:34:32.840887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.829981Z","title":"MMEngine: Openmmlab foundational library for training deep learning models","venue":null,"work_id":"e10fb3d2-075b-4259-be62-ca6728cbb15b","year":null},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:0900eb863515d3ada16fa1b3b97aff1c1e1dc4da6b21c6c4bbe946c21b10b82b","observation_id":"0a0d9803-7ce2-4924-b3d8-ac51f9fb4e28","resolution":{"observed_at":"2026-07-08T03:34:32.831285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.837598Z","title":"Physics: Benchmarking foundation models on university-level physics problem solving","venue":null,"work_id":"ca6011fb-17f3-4b6a-9863-2def947c1d20","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:e4fae6163a7491e161d26569404577ad905fc92b8017770124c247e2f716a40e","observation_id":"ae30e3c5-e26f-4805-b60b-d8e64ac5360a","resolution":{"observed_at":"2026-07-08T03:34:32.838966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:a8b26f41c322ad15b5a63efc31be74213f6f0d850e82a5feef9b6897177fa8f8","observation_id":"f71df103-5455-45a5-b596-6a14c78bacfb","resolution":{"observed_at":"2026-06-30T18:45:00.508507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.821290Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":"3914e57f-a5d7-4eb5-9236-0b0b42712964","year":2021},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:ee080c01ae2f2cdb4c5996dca69c216bb33eab662e89f79cd7baff1ea108bf0e","observation_id":"70f6b27c-8ebd-45ff-9323-15ff9bc55762","resolution":{"observed_at":"2026-07-08T03:34:32.822755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":"2404.06654","doi":"10.48550/arxiv.2404.06654","metadata_source":"pith","pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-07-10T20:07:33.531106Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","venue":"cs.CL","work_id":"c0bc4689-3ce8-4e3d-9442-bd74869445bb","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:83f6187a3f172d218f649715707f2897f9b337a3011014d67147fa45ba2cd395","observation_id":"fd4e5296-2d2d-4cfc-a779-b68347ca344a","resolution":{"observed_at":"2026-06-30T18:45:00.505348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":"2403.07974","doi":"10.1109/icsme52107.2021.00025","metadata_source":"pith","pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","venue":"cs.SE","work_id":"ea9e51ce-1e75-4182-92d8-4d25f70d2ee4","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:88387ad141b570b4ed491aaf46862ce88bcb58df052f76313afbd704c6daa42f","observation_id":"84eeaa5b-4d63-4434-92fd-42e42ae12c6d","resolution":{"observed_at":"2026-06-30T18:45:00.513123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.835799Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"25e7006d-b8df-4acf-a556-7e488f5bc2bb","year":null},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:55473d7d8b28e0c158586153ccbefcbc814300790ef01cc60c5ee4ac5218f3c8","observation_id":"d4a2c6f4-899c-40a1-9da6-64e7ebe254a9","resolution":{"observed_at":"2026-07-08T03:34:32.837020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16701","last_updated":"2025-03-09T18:31:12Z","snapshot_observed_at":"2026-07-06T19:37:38.112629Z","submitted_at":"2024-10-22T05:12:19Z","title":"ClimaQA: An Automated Evaluation Framework for Climate Question Answering Models","version":2},"cited_work":{"arxiv_id":"2410.16701","doi":"10.48550/arxiv.2410.16701","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.16701","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Climaqa: An automated evaluation framework for climate question answering models","venue":null,"work_id":"91de4d08-55e2-419c-ab18-1922e483d2e1","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2410.16701","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:ca87d2cddac434b79b6f9772151de2a82694d802ba1f8e06ec537deea21d070e","observation_id":"8fa6604c-aee4-4044-a3d5-dc3a1c4a6f20","resolution":{"observed_at":"2026-06-30T18:45:00.510578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:bcd24e785f6c49e1fd0b0dcfd0985a168a6822850aa76287fe1032849d641ae9","observation_id":"9b8e936d-3c4c-4ce4-bb92-ef402ad1dd3c","resolution":{"observed_at":"2026-06-30T18:45:00.519875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:36561a668dad67cef9078718c8957c0932248c67f95106389947f18777cae1c3","observation_id":"04cfaca0-f851-48e4-a4ea-333a348a2415","resolution":{"observed_at":"2026-06-30T18:45:00.522603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.843360Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":"daf8d71a-01ba-49c9-9ab3-1cdb046da3aa","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:bf3f0674a0ecb70bb9749a97c44b0d7e3d47ab8b58a466e2c729b1ffe3a8b574","observation_id":"c8e155bb-869b-40e6-a463-0ed768a3a19c","resolution":{"observed_at":"2026-07-08T03:34:32.844694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.833773Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"991c21e5-d530-4768-9bc0-7893018f3aea","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:bba7b9f6c799ab016e67ea7f9ce0052d0d1e1c2c4adebe8a2da7c1b72d9ff0d1","observation_id":"00e1dd4e-1e7b-4a83-a767-4a376a74bd9e","resolution":{"observed_at":"2026-07-08T03:34:32.835142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":"2411.04368","doi":"10.48550/arxiv.2411.04368","metadata_source":"pith","pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Measuring short-form factuality in large language models","venue":"cs.CL","work_id":"f8e490ab-7057-43fb-8c6d-06fc603836c7","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:4a7ed9e5d91fdee3d4d01bfeb2daa56d8528457ddfa06da477c109555c82ac3f","observation_id":"f8ec25ec-0c30-4789-b8ab-79d0c0058f19","resolution":{"observed_at":"2026-06-30T18:45:00.504164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.825862Z","title":"Openicl: An open-source framework for in-context learning","venue":null,"work_id":"1b04ecb7-9bef-48d9-893b-9d24ac1614e1","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:67e4a3685d75fba8b59fd76cbe767d227cbfc425aa6f47344a6ae930042ddc19","observation_id":"69ed31f7-26d3-426e-a763-6ef3bf3c226b","resolution":{"observed_at":"2026-07-08T03:34:32.827268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09391","last_updated":"2024-08-10T13:28:11Z","snapshot_observed_at":"2026-08-04T14:26:55.582131Z","submitted_at":"2024-02-14T18:42:25Z","title":"LlaSMol: Advancing Large Language Models for Chemistry with a Large-Scale, Comprehensive, High-Quality Instruction Tuning Dataset","version":4},"cited_work":{"arxiv_id":"2402.09391","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.09391","snapshot_observed_at":"2026-07-03T13:48:20.828423Z","title":"N.; Chen, Z.; Ning, X.; Sun, H","venue":null,"work_id":"a673bb59-ff38-4b43-a4f3-13bc7b33a5ca","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2402.09391","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:eda2a05fa39c35a98c02592797dc67b372cc894958e99ef60aaec1b307e6b0c5","observation_id":"79721af4-5f87-4c63-b9df-a67a3c703a6a","resolution":{"observed_at":"2026-06-30T18:45:00.507659Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.823430Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 61st Annual Meeting of the Association for Computational Linguistics (ACL)","venue":null,"work_id":"e0765442-b617-4156-9571-6e3dcca57063","year":2019},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:b3f15969a1b16cfd8af30b45671384e6b44f977e9b993ebba2ea8d3fdbf356b8","observation_id":"4342b2be-848a-402f-a365-b2b45a0d70d9","resolution":{"observed_at":"2026-07-08T03:34:32.824937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.827912Z","title":"P-mmeval: A parallel multilingual multitask benchmark for consistent evaluation of llms","venue":null,"work_id":"381ab676-0212-4b38-bec8-42d214fd67cf","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:3fde996bfbee56d2a1048700651b4758da2ffebaa1faede97403e11ac5e2411c","observation_id":"a0f67ffe-b832-4361-b884-a0bb14748663","resolution":{"observed_at":"2026-07-08T03:34:32.829275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-07-10T12:07:03.672931Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:d68ab12cb6ad0804b72ac7902b603b38881ae438bdcae0f8e896729a9853f0b4","observation_id":"0652a02d-29a8-4341-afe0-b8e1c143abd8","resolution":{"observed_at":"2026-06-30T18:45:00.527674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-07-31T19:00:59.311189Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":"2406.15877","doi":"10.48550/arxiv.2406.15877","metadata_source":"pith","pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","venue":"cs.SE","work_id":"14715c3c-002c-4bc4-8882-f7c586954d62","year":2024},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:9df1fc02eb393cb0f0ac9b73800ccec194e665bea5bb49f609fe9882d0e94050","observation_id":"b523fd04-a9c8-4360-9e61-e2e1b58b08f1","resolution":{"observed_at":"2026-06-30T18:45:00.525070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:34:32.831907Z","title":null,"venue":null,"work_id":"16536eb6-0444-49fd-b5b7-048a8b959a95","year":2025},"citing_paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T18:41:34.878542Z"},"links":{"citing_paper":"/paper/2605.19276"},"observation_digest":"sha256:3ed9d621f987f97a3348544a8a09db952b09d08593b624908b61d3509f52834b","observation_id":"49ce5992-0ec6-407e-a9eb-ef2370e8097e","resolution":{"observed_at":"2026-07-08T03:34:32.833117Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19276","last_updated":"2026-06-08T02:37:16Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T22:22:39.595762Z","submitted_at":"2026-05-19T02:50:11Z","title":"OpenCompass: A Universal Evaluation Platform for Large Language Models"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":11},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2605.19276."}