{"as_of":"2026-08-13T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:524ab1c0fa4b5040efd35a7038c175d944bd4a12e6de7240d7a812886b759234","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T13:27:06.770620Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16239/citation-record","integrity":"/paper/2411.16239/integrity","json":"/paper/2411.16239/citation-record.json","paper":"/paper/2411.16239"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.075116Z","title":"The multiple-choice question should provide four answer options, with non-correct options being similar or related to the correct answer","venue":null,"work_id":"1e199b80-62d9-4ae1-80b8-2c8fc8ef50f0","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.701093Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:ea4f50fab2b0e8f3d598bf0d468b84231ea4eeb325e917f0f541bdf47c2eb3b2","observation_id":"d6223f76-b8bf-47fc-9623-9235a82aa926","resolution":{"observed_at":"2026-08-12T13:27:07.079989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-12T13:27:06.690101Z","title":"https://github.com/XuanwuAI/SecEval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.690101Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:a6e3442f5fe72fabee63e79a7d9878c50068294eaf368d6131d7cdd1f3f6270d","observation_id":"38462fc9-d789-48ce-8a39-a724681605a7","resolution":{"observed_at":"2026-08-12T13:27:06.690101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.045061Z","title":"Offer four potential answers, making sure that the incorrect options are similar to the correct one","venue":null,"work_id":"232ec73d-f7be-4634-a806-b6a2812f77c9","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.711343Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:91bc94ee747dbf23072628e540b514c7ff3b3fd1b0f2ab140a0764c449b8ab32","observation_id":"d0bfada8-5a51-4057-b44e-477677586e40","resolution":{"observed_at":"2026-08-12T13:27:07.049896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.030158Z","title":"Offer yes or no answers","venue":null,"work_id":"434fa275-1cbc-4e50-897e-88150a835332","year":2023},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.716027Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:81cec8ed617f14b6523032f710e6ab136313fd8c853a432b6f296a243565ba33","observation_id":"6df72d61-22f0-4855-ab47-4fc5765188aa","resolution":{"observed_at":"2026-08-12T13:27:07.035024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.060156Z","title":"Provide four possible answers, including the correct one, and make sure the incorrect choices are similar or related to the right answer","venue":null,"work_id":"56ea3a39-69a8-4e36-a55b-154ae9118d37","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.706171Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:11c5dca0f6235a16353baccb1254858eaa6e3854920840c6b77300ffd357feba","observation_id":"8c4f9870-5a72-4fed-bbdf-e1c023fc4010","resolution":{"observed_at":"2026-08-12T13:27:07.065007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.936538Z","title":"For example, if the original question asks about the result of a specific action, the reversed question could ask about the conditions re- quired for that result to occur","venue":null,"work_id":"4ba50a6a-ae99-4769-a085-40bf066d2d5d","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.747016Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:37fcf40bb1132752eb6586053ef3dbe3f5db9a480a1f92f7b8771433297d651d","observation_id":"d68ade81-76a4-41a5-99d2-0bfc6aa4c32d","resolution":{"observed_at":"2026-08-12T13:27:06.942721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.919993Z","title":"{Original Question}","venue":null,"work_id":"f35e9f07-433f-4585-ab72-1a27cd05d484","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.751817Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:2ae1a5540f3911233f477427ac7c307431fcc800ac5c632acf9f1088e13462b2","observation_id":"98dceb1b-d886-491e-bdd1-fc5ac4448c79","resolution":{"observed_at":"2026-08-12T13:27:06.924730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:07.015468Z","title":"Ensure the question still tests the same core concept","venue":null,"work_id":"e681b946-b0e9-448e-95af-468f593d3521","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.721287Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:9cb317a762af0a987f5f1b3cefd7282663fbab95ccb1e1fad5e08691b67ec628","observation_id":"d10afb71-f4bd-43cc-a5be-7651a4b6a3a4","resolution":{"observed_at":"2026-08-12T13:27:07.020332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.998833Z","title":"{Original Question}","venue":null,"work_id":"fa0517c7-afb3-4184-934d-d2fcb133aef4","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.726245Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:deac1cffdee9609af0365ae51715f9e0489796e9f678004f848a89fd90a6e5d9","observation_id":"6f5c699c-3d24-4cb3-8fd2-4efc46a1bb4b","resolution":{"observed_at":"2026-08-12T13:27:07.003477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.983710Z","title":"Ensure the question remains rel- evant to the original cybersecurity concept","venue":null,"work_id":"0c818fea-406b-4f86-ac18-f0fa93ea3b4a","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.731701Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:103e213f54e8b4e587eb336affc9f093711f35244acc7dac5b781cb6ed74ada3","observation_id":"4b3bccfe-1558-42fa-8dc6-b1f553948c51","resolution":{"observed_at":"2026-08-12T13:27:06.988704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.968719Z","title":"Ensure the question tests the same concept","venue":null,"work_id":"6fe3cfbf-f439-4393-97bc-ef90965e0755","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.737061Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:954f7cac07899fe46a1ef169e7e1c96e3f282d3701287bf59ee82189651bddaa","observation_id":"6f6fb752-538b-4d2b-9ff7-889b47deb4b2","resolution":{"observed_at":"2026-08-12T13:27:06.973659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.953689Z","title":"{Original Question}","venue":null,"work_id":"c4c8f3c7-c992-4e11-a7bb-d0f5a0675557","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.741964Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:35d1c286394709c40332104adae8ed6147842431c8f588010f8fb02d414c28bc","observation_id":"cfa993c3-36fb-4edb-9287-05d0d6f95d69","resolution":{"observed_at":"2026-08-12T13:27:06.958427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.904282Z","title":"{Original Question}","venue":null,"work_id":"6e0be892-393f-4236-a3c7-da7ed3ac1e1c","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.756418Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:45c052ba31d8c54a62de145778af46b091efe149ba300d7cfbdc5edd779a00d8","observation_id":"323ec978-3e5a-440d-88a4-d35f6f3171bd","resolution":{"observed_at":"2026-08-12T13:27:06.909168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.887478Z","title":"{Original Question} Table 8: Prompts for Question Reformulation Prompts for Dynamic Question Generation, Part 2","venue":null,"work_id":"87a33c1e-6597-4fff-b62a-65cdc741c346","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.761073Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:3006c1a8aa370a1d56406ec901f6b8b8a679108a44354ed2179d5965980050d0","observation_id":"44b35c47-9be7-4d36-9956-5958f5560fa7","resolution":{"observed_at":"2026-08-12T13:27:06.893060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.870795Z","title":"The questions are: {questions} Reply to me in the following format: ‘‘‘json [’knowledge point 1’, ’knowledge point 2’, ......] ‘‘‘","venue":null,"work_id":"6f28da2f-54d3-4bb4-a157-e762a8d10bc8","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.765625Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:9940884489bcb06689de28d30d0163a8df75f37d8bffca14baa49abcbdac617d","observation_id":"916c879d-c879-41e5-b1dc-62767bbb9eee","resolution":{"observed_at":"2026-08-12T13:27:06.875943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T13:27:06.852360Z","title":"Then rewrite it as a multiple-choice question by leav- ing one key position blank","venue":null,"work_id":"3082d13b-431a-4447-9e8d-edc750a73f9f","year":null},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.770620Z"},"links":{"citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:c40c06b4c6b96f90003d28eb5754fabf6dd3eb00836a03d4151b00c5bbd1f03a","observation_id":"578995e8-0ca9-487b-8545-69d61c8db5c8","resolution":{"observed_at":"2026-08-12T13:27:06.859231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-13T00:15:47.844263Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-12T13:27:06.683416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.683416Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:166c134373ed5a79e6b32d176dd2be05ad3f04d68ecb05baf53bfe713116f650","observation_id":"cae6d39c-90b5-48ae-abba-8f30f0f0f551","resolution":{"observed_at":"2026-08-12T13:27:06.683416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09975","last_updated":"2024-12-08T06:34:31Z","snapshot_observed_at":"2026-08-10T23:50:11.353797Z","submitted_at":"2023-08-19T10:38:00Z","title":"FinEval: A Chinese Financial Domain Knowledge Evaluation Benchmark for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09975","snapshot_observed_at":"2026-08-12T13:27:06.695774Z","title":"High-Confidence Computing, 100211","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-12T13:27:06.695774Z"},"links":{"cited_paper":"/paper/2308.09975","citing_paper":"/paper/2411.16239"},"observation_digest":"sha256:29a34b32d2ef26570bb1a84c1fba72922b74acf83f5e5b8eda7eb382b7160432","observation_id":"c1ad2b14-06d5-4e86-a267-0758ad84bb32","resolution":{"observed_at":"2026-08-12T13:27:06.695774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16239","last_updated":"2025-01-17T04:19:43Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-12T13:18:31.444448Z","submitted_at":"2024-11-25T09:54:42Z","title":"CS-Eval: A Comprehensive Large Language Model Benchmark for CyberSecurity"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2411.16239."}