{"as_of":"2026-08-21T06:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:feff4a8afc1d68c3d812aafcf0e450eb7d6fc4d73e809ba48f6d78b3537f8522","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-04T01:22:59.320550Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.23965/citation-record","integrity":"/paper/2605.23965/integrity","json":"/paper/2605.23965/citation-record.json","paper":"/paper/2605.23965"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.093376Z","title":"In: Christodoulopoulos, C., Chakraborty, T., Rose, C., Peng, V","venue":null,"work_id":"e6d6ecae-3575-45e2-8c99-76359a926a1a","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:94a2f1f0e2480c70b339fb7d686e8fdac0cb8098839f6d47066410bad577a051","observation_id":"c919cafc-370e-4ea2-9a85-e961ba16780b","resolution":{"observed_at":"2026-07-04T01:29:21.775751Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:08:10.343755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1524.2021","doi":"10.1109/ase51524.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Nguyen and Raymond Choo","venue":null,"work_id":"9a66d605-e86f-4d80-b1d1-2faf3b730204","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:94ad255419dfd41e064866dc87995718f00a02f647346eeb9c2cdead889df4e7","observation_id":"49b0abed-c7e0-4fc8-96d2-40228109f60b","resolution":{"observed_at":"2026-07-04T01:29:21.746311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.125778Z","title":"Metamorphic testing: A new approach for generating next test cases","venue":null,"work_id":"5747509b-e0a0-488b-a879-cba7f8ce4f40","year":1998},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:a78c699112fcfbdaf550315c2f4334e7ebd7f5ef035adc3edf558b5d54414816","observation_id":"9295fe30-bd9a-4d07-b2e1-9444c3393c50","resolution":{"observed_at":"2026-07-04T22:30:11.019546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.127561Z","title":null,"venue":null,"work_id":"cb9b50e4-0379-4edf-a7cc-6e4690965711","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b7a05135f6ae0b7f72b0e49aa60bf317551bcfffff43efd82e49cbba60e11111","observation_id":"69deb20b-1e0e-4236-8e96-24b8741c32ae","resolution":{"observed_at":"2026-07-04T22:30:11.029154Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3143561","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Available: https://doi.org/10.1145/3143561","venue":"ACM Computing Surveys","work_id":"3a040ea4-7239-4436-af1f-e1fa75709463","year":2018},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:537fc54b6b51301e970501a2a5ca1190b2e5418a93351fe3c09741959cd3b886","observation_id":"c58ff1e9-5b43-43b4-ac5c-3bb8e65fda7e","resolution":{"observed_at":"2026-07-04T01:29:21.748908Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-10T21:38:27.29984+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T21:38:27.29984+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:4bb9cfb10b4b850a454829d21b6c7ed3abec40e76e498f1c9d68f07939f7995b","observation_id":"1f3824e9-75e9-4ac1-8ae4-7384ffb3553d","resolution":{"observed_at":"2026-07-04T01:29:21.708295Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:a3e82b642fed83b49cc3e6aa796f454414dbe776ac53be4c69b8e9bede5753f9","observation_id":"76915796-726a-4136-acb8-cf38ac796633","resolution":{"observed_at":"2026-07-04T01:29:21.721448Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.129136Z","title":"Transformers as soft reasoners over language, in: Proceedings of the International Joint Conference on Artificial Intelligence, pp","venue":null,"work_id":"78d788ef-b33b-45af-a7c4-242c17423384","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:9cae3ce9e9da9fcc27376fa0e404e34bee60bffc8b5717225f7230e93aaf3667","observation_id":"90a9a5b3-ba65-4a4a-b215-a06901d912c0","resolution":{"observed_at":"2026-07-04T22:30:11.032267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1706.1968","doi":"10.1080/00401706.1968.10490621","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Errors of measurement in statistics","venue":"Technometrics","work_id":"6a43c776-b734-463e-9f49-6f3185475cbd","year":1968},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b38941edebfc02d6f8fbcaea3c42fde208230a4feee98b78944838d8e28ae2c1","observation_id":"a5530c2a-1dd3-4213-9539-4b343dfc168d","resolution":{"observed_at":"2026-07-04T01:29:21.779147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.585","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explaining Answers with Entailment Trees","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"7e70c254-1569-4615-9b6c-a1edc0071138","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:8c03fe6ba62e787e65d603c5db904bf167a446f21b00f6a336e695c12376b44c","observation_id":"c7c15b9b-3054-4dae-bd9d-9e1031c07d2c","resolution":{"observed_at":"2026-07-04T01:29:21.807703Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b5a927909ba7f64c8f69358c42c44f2d143341e390a1503aab9c24e948708783","observation_id":"9f41835a-81b5-477f-8442-673075927669","resolution":{"observed_at":"2026-07-04T01:29:21.794051Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.140109Z","title":null,"venue":null,"work_id":"c5c18f33-4add-4a82-97b6-055170017867","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:d7d9b0c4482a01c0ee202e3acd61e40bd91b983ba4fd8f15275ea9eb10c7b205","observation_id":"b456f161-9fe1-458e-93db-c0eabacf0b26","resolution":{"observed_at":"2026-07-04T22:30:10.992729Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-14T04:42:19.578053Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":"2406.11931","doi":"10.48550/arxiv.2406.11931","metadata_source":"pith","pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","venue":"cs.SE","work_id":"713a39be-8c4e-4ee3-8671-11cf9379262f","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:6cc053b3427054a5d64dfe0b2949f6924235858a4b7fe7517e752298e98c68da","observation_id":"c026078b-80bb-48cd-89d9-cf1b91f96d02","resolution":{"observed_at":"2026-07-04T01:29:21.787927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.141750Z","title":null,"venue":null,"work_id":"3daf6626-28fe-48d0-8c61-7adaf7009a58","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:94c1d01194ec52954ab699d261a71a030e976fe9ec5029341bdd40a0747d124a","observation_id":"d9936f2d-0d02-4c2b-a7c6-a41a0c1f519b","resolution":{"observed_at":"2026-07-04T22:30:11.054170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.134411Z","title":"70293–70332","venue":null,"work_id":"3818dab7-a237-4189-aa37-de9f26b78c50","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:17d96c7cdd2a02e521eeb0f902d6dd37dae68e42aaa970d89b55dcc97e66f739","observation_id":"3de5d91f-d6a0-4968-b255-bc2f7da4b8a2","resolution":{"observed_at":"2026-07-04T22:30:10.997837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.136128Z","title":"Logical consis- tency of large language models in fact-checking, in: The Thirteenth International Conference on Learning Representations","venue":null,"work_id":"d9bc1cd7-8ab5-4aa8-bcff-4fff2674f861","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:a0d5925202101c6be31b7fbde0ee5c46c4bb79a46a8a348541bb0c0d4d1b7baa","observation_id":"567ac94d-5abf-4d8e-8d78-77e0ec07e2ca","resolution":{"observed_at":"2026-07-04T22:30:10.895199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06677","last_updated":"2023-12-04T07:51:58Z","snapshot_observed_at":"2026-08-16T14:37:57.716610Z","submitted_at":"2023-12-04T07:51:58Z","title":"Intelligent Virtual Assistants with LLM-based Process Automation","version":1},"cited_work":{"arxiv_id":"2312.06677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06677","snapshot_observed_at":"2026-07-04T01:29:22.057834Z","title":"Intelligent virtual assistants with llm-based process automation","venue":null,"work_id":"9699e4c8-af09-4787-89c0-5a1bd0a9448f","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2312.06677","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:71ae72a29e8aa3a404c2a8ede2907a511027a8e3bfb885ac55f506eef4d60220","observation_id":"5884b6ab-5c89-4837-af9e-7543782b1e93","resolution":{"observed_at":"2026-07-04T01:29:22.059350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:17:03.600265Z","title":"In: Zong, C., Xia, F., Li, W., Navigli, R","venue":null,"work_id":"8d675bdd-79ca-48d6-9163-fc17ce0e8ece","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:60c26c3ee75d4f6e4e27958ff79c55ecf306cf1e2948fc7bd99f9ea9eef65645","observation_id":"e0e37fc7-d403-45c1-b13f-8329851b54bb","resolution":{"observed_at":"2026-07-04T01:29:21.817585Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.222","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Conditional andmodalreasoninginlargelanguagemodels,in:Proceedingsofthe Conference on Empirical Methods in Natural Language Processing, pp","venue":null,"work_id":"2aea739a-1498-46fa-a93a-d1433129f2c4","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:034429aa44e23d3a24ff76b1b4373ea6dd598e63b6fe3c10298ddca342524581","observation_id":"8d57016a-6882-463f-b57d-9b1e2334ba69","resolution":{"observed_at":"2026-07-04T01:29:21.754732Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.132791Z","title":null,"venue":null,"work_id":"69685866-c966-4f83-b1aa-79afd96b299c","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:f69cb6561ae6975c9629755646902d5c912591eed483fc5534f845de6f445a48","observation_id":"761453ab-d752-41f8-abbc-37edaa13976d","resolution":{"observed_at":"2026-07-04T22:30:11.003634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3703155","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:07:20.243096Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":"ACM Transactions on Information Systems","work_id":"ed8c5be1-1069-44c0-8dc4-627a7de3a371","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:148162e3f903b0b4c0e7ffb3bfe9bc5ba06d7d91376f86adb6cbd5726042c08d","observation_id":"d621aa70-15c9-43f8-a41e-698253c70746","resolution":{"observed_at":"2026-07-04T01:29:21.724479Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T01:38:03.678418+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T01:38:03.678418+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0714.2024","doi":"10.1109/icst60714.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Differential optimization testing of gremlin -based graph database systems","venue":null,"work_id":"0c7e709b-ec4d-4f34-81c6-6e744d37c057","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:025d558d373205f91df4ab9524daae4308b1cfbe7fca7dd31414ea608100d529","observation_id":"e730553b-e7cc-46aa-b033-315f3a7d7360","resolution":{"observed_at":"2026-07-04T01:29:21.734484Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:21:01.968911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:21:01.968911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.138443Z","title":"16889–16914","venue":null,"work_id":"668fd75f-015f-467c-a672-de0c0be442d6","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b0a5e9c5aef2e0c74acf72617e039fac8410f8550615baef14ceba5ba6ae4889","observation_id":"cf47d0db-4f5c-42ca-8187-b4678cf96a46","resolution":{"observed_at":"2026-07-04T22:30:11.059770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.143357Z","title":null,"venue":null,"work_id":"eeeadf73-4d9d-4d98-b99a-792b1e027467","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:362b7b3990b355ad9ab2e4af80303f7dffda2d79a234e42c302c902b87d409b6","observation_id":"50870515-d37f-471b-ac3c-a553fe73202a","resolution":{"observed_at":"2026-07-04T22:30:10.960304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":"2310.06770","doi":"10.1145/512927.512945","metadata_source":"pith","pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","venue":"cs.CL","work_id":"d0effe15-a689-441a-8e3f-ea35f1c4e4b1","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:82bde9dd1eb01c13d7dd80936b465336e3c0854ca064ef7801963f9bd854c38d","observation_id":"141045f4-5d0d-4f43-a129-22d2832051e5","resolution":{"observed_at":"2026-07-04T01:29:21.767038Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.130947Z","title":"Retrieval-augmentedgenerationforknowledge-intensive nlp tasks, in: Advances in Neural Information Processing Systems, Curran Associates, Inc","venue":null,"work_id":"5939347a-3705-4476-92c0-0d665e265654","year":2020},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:9a1f7bf7e2293fe02a3e0f5622f4be45d368bb7bd9df7b56812f1acc1a7f0224","observation_id":"e3ba912d-575a-4c3e-902f-b763d0593ec9","resolution":{"observed_at":"2026-07-04T22:30:10.979099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3689776","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Drowzee: Metamorphic testing for fact-conflicting hallucination detection in large language models","venue":"Proceedings of the ACM on Programming Languages","work_id":"2f7b875b-909f-4229-b245-5e18f34a746a","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:48326c8a59398bf28c7d0655696d581da56eeac63bd5ec47c7baa91291324889","observation_id":"f7edbb65-328e-4a3f-9ba5-b78afdf7d2e0","resolution":{"observed_at":"2026-07-04T01:29:21.815203Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11854","last_updated":"2025-05-17T05:36:14Z","snapshot_observed_at":"2026-08-16T17:40:54.467150Z","submitted_at":"2025-05-17T05:36:14Z","title":"Evaluating the Logical Reasoning Abilities of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.11854","doi":"10.48550/arxiv.2505.11854","metadata_source":"pith","pith_arxiv_id":"2505.11854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating the logical reasoning abilities of large reasoning models, 2025 a","venue":"cs.AI","work_id":"6dbfd621-0f11-4c5c-b082-a1f07aaf0ddc","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2505.11854","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b905e0ca1e0f92fc666cc55fa70d444a9c10ee3b81023c7355d9eb3d59f4aa4e","observation_id":"361e4689-1d8b-4abd-a9a5-acbb087746ee","resolution":{"observed_at":"2026-07-04T01:29:21.764000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1440.349194","doi":"10.5555/3491440.3491941","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Logiqa: a challenge dataset for machine reading comprehension with logical reasoning, in: Proceedings of the International Joint Confer- enceonArtificialIntelligence,pp.3622–3628","venue":null,"work_id":"33efe195-28ef-4b0c-a4d2-fa332b31acf6","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:dd0767507f444613fcf840335f1935a4e99966eab55d46943a9d47d3964f5b81","observation_id":"097a5bfd-dcf1-400d-a6db-4c8784b0699b","resolution":{"observed_at":"2026-07-04T01:29:21.714904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00836","last_updated":"2024-03-31T01:02:55Z","snapshot_observed_at":"2026-08-18T13:31:30.534326Z","submitted_at":"2023-10-02T01:00:50Z","title":"Towards LogiGLUE: A Brief Survey and A Benchmark for Analyzing Logical Reasoning Capabilities of Language Models","version":3},"cited_work":{"arxiv_id":"2310.00836","doi":"10.48550/arxiv.2310.00836","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.00836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards logiglue: A brief survey and a benchmark for analyzing logical reasoning capabilities of language models","venue":"arXiv (Cornell University)","work_id":"6914be6d-398e-4662-abd1-5f74663cbded","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2310.00836","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:7b7c0f3f6e1641e76d7f8db6d73f0bddbadbf38ded1daf6c3478b7133257751e","observation_id":"a75b04b7-fb3e-4ecb-855a-68841d6a2c7e","resolution":{"observed_at":"2026-07-04T01:29:22.064707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.145002Z","title":"Beyond accuracy: Evaluating the reasoning behavior of large language models - a survey, in: First Conference on Language Modeling","venue":null,"work_id":"7386892d-8c47-4b69-85fd-2fedb38b4bfd","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:d7a2b7e30acf3c9bece0a4c26aaf0d7c88695041ed9770b2b8600cf9e54dd982","observation_id":"7106473c-3560-4ab8-b86c-64e58fdf2631","resolution":{"observed_at":"2026-07-04T22:30:10.953204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.116980Z","title":null,"venue":null,"work_id":"ef6e4ab7-d800-4f14-aaef-0ee15c3d7483","year":2008},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:8133b778349c6f643c2ba7483d2ef2741cee1c531df215f844737d2912330ead","observation_id":"a1695432-b589-4d47-bb6a-4ea95999471a","resolution":{"observed_at":"2026-07-04T22:30:10.975749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:30:06.904853Z","title":"Yifan Li, Yifan Du, Kun Zhou, Jinpeng Wang, Xin Zhao, and Ji-Rong Wen","venue":null,"work_id":"8122370e-553b-4d6f-b1a8-98e24c010366","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:2ef093a23034c270bca8732d77d081faa488c446fb851deed3bd8c1398bf5d2c","observation_id":"b3d208d2-36cf-450c-82fe-5e9768379c85","resolution":{"observed_at":"2026-07-04T01:29:21.751947Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:08:10.998972+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:08:10.998972+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.118500Z","title":"Logic-lm: Empoweringlargelanguagemodelswithsymbolicsolversforfaithful logical reasoning, in: Proceeding of the Conference on Empirical MethodsinNaturalLanguageProcessing","venue":null,"work_id":"b9bb92aa-ea32-4d50-91a0-ca3b766448a9","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:7e065be58bc8ba38adc43acc31ce786f3b1010e9425d5de7c6919e7370631473","observation_id":"c020cf22-54e6-4ee3-8862-54876d6efa7e","resolution":{"observed_at":"2026-07-04T22:30:10.935148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06024","last_updated":"2024-12-24T01:11:04Z","snapshot_observed_at":"2026-08-16T14:36:04.212305Z","submitted_at":"2023-12-10T22:38:36Z","title":"Thinking Assistants: LLM-Based Conversational Assistants that Help Users Think By Asking rather than Answering","version":4},"cited_work":{"arxiv_id":"2312.06024","doi":"10.48550/arxiv.2312.06024","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06024","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking assistants: Llm-based conversational assistants that help users think by asking rather than answering","venue":"arXiv (Cornell University)","work_id":"af7154b9-585e-472e-ad09-04477a1679f7","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2312.06024","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:adae09edd402cf083714537c2e9323eca3d062029e5435bc400c46e8b5825888","observation_id":"26e45428-eb44-4d4f-9b67-bfc0ff1323eb","resolution":{"observed_at":"2026-07-04T01:29:22.061952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.739","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L ogic B ench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models","venue":null,"work_id":"2bb405db-edcc-4680-ad13-046ad639745f","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:4f079d34f56057cf660e20cafbcd79a950d426329dc12b729fb7f4b8498ffc30","observation_id":"4e587e0a-2aa3-4a2e-a35e-6b80a02fcf30","resolution":{"observed_at":"2026-07-04T01:29:21.773800Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wu, T., Xiang, C., Wang, J","venue":null,"work_id":"0d369b18-4903-4166-a445-d4b66648d0b5","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:61dba3bdee6d00b3ba315975c447ce6a649443bc619eb7c2582303babaf9c6ec","observation_id":"996e1536-d018-462f-9f0b-507f8d883bd1","resolution":{"observed_at":"2026-07-04T01:29:21.821972Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-14T21:38:13.014163+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-14T21:38:13.014163+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.120345Z","title":"Large language models meet symbolic provers for logical reasoning eval- uation, in: Proceeding of the International Conference on Learning Representations","venue":null,"work_id":"51aab2c4-1b7e-45be-9ad2-60f2c6931721","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:6ae272d2942aef419db5ec4816813637b622f4efc7ff1d678124cead89145428","observation_id":"8aa4b073-cb70-4e8b-a1b9-d407f4d92d41","resolution":{"observed_at":"2026-07-04T22:30:10.901770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:9c926a0b60b6a11bc6b8752a230755197d93c9427415706f0d26dc1d5bace58c","observation_id":"5fcefd3b-0f24-4a5c-8a0d-7b12e8d627d5","resolution":{"observed_at":"2026-07-04T01:29:22.056569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.122193Z","title":"Language models are greedy reasoners: a systematic formal analysis of chain-of-thought, in: The International Conference on Learning Representations","venue":null,"work_id":"b0b83872-ffd8-4145-b84a-bcb01d163415","year":2022},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:a33da73880c25c539a1cbb9ede0d893c2d6eb97da5476f55670b22958658c373","observation_id":"9cb7a9a4-1098-49af-8edf-c73cf1ee7baf","resolution":{"observed_at":"2026-07-04T22:30:10.953791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.253287","doi":"10.1109/tse.2016.2532875","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Trans","venue":"IEEE Transactions on Software Engineering","work_id":"b5595df5-a701-4717-ae2d-02426d9b6deb","year":2016},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:bfd0efb750dc6ba4011fb21f642914727350926fce311771dfc1d3e424aae00e","observation_id":"fd744f83-7ee0-457d-9ec8-0fb17e6cb5ab","resolution":{"observed_at":"2026-07-04T01:29:21.785087Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3708778","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Arelargelanguagemodelsgoodatfuzzyreasoning?, in: Proceedings of the International Conference on Computational Intelligence and Intelligent Systems, pp","venue":null,"work_id":"bc1128cb-b8f1-498c-9283-9e2e7da015a6","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:83a2d89a426859d8b8a02aed9cfd4e7b5e9cf17956811d93da22835b8706ba4c","observation_id":"0ed50b9b-3293-47c4-b70e-baf32f3f4eb9","resolution":{"observed_at":"2026-07-04T01:29:21.729099Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d19-1458","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hamilton","venue":null,"work_id":"6030394f-4ae4-4629-a66b-b01420ee6bd7","year":2019},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:bbd51ef6be956558a89b5a1e6c400cdabfeb583ca06372e3aa4fcd9b10233925","observation_id":"724c07b2-cc80-4923-ac60-26a35fd5ef2c","resolution":{"observed_at":"2026-07-04T01:29:21.771896Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:43.010687+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:43.010687+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T01:29:21.735392Z","title":"https://doi.org/10.48550/arXiv.2509","venue":null,"work_id":"dde53a84-8dc6-4f50-98b8-df0d46054c9e","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:e5e84a69d098e3877ac6116f78b659c947ebad2712a4bff63224c053e130387c","observation_id":"4adfa41b-15cf-42c0-83d4-cdfeb1b706da","resolution":{"observed_at":"2026-07-04T01:29:21.737950Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-20T17:52:26.422976+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T17:52:26.422976+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.123952Z","title":"Challenging big-bench tasks and whether chain- of-thought can solve them, in: Findings of the Association for Com- putational Linguistics: ACL 2023, pp","venue":null,"work_id":"a154f2e3-25db-4c34-af96-a2d5908b549d","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0ad804879e94db3e340bac274b7ac5dea50cf1464e9c1addc393d3f8efaa1628","observation_id":"9fc98283-8805-4ea4-8143-1546618dba56","resolution":{"observed_at":"2026-07-04T22:30:11.010980Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.findings-acl","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proofwriter: generating implications,proofs,andabductivestatementsovernaturallanguage, in: Findings of the Association for Computational Linguistics: ACL- IJCNLP 2021, pp","venue":null,"work_id":"8a2f289b-c4ee-4d95-b4c7-add190212653","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:05d2a68fe44893cd7c8b84e3e51e255ebdffbc6d1937ce9e53fcb8982140cd1d","observation_id":"f5526ee9-e77c-431d-8194-ba31e04e1482","resolution":{"observed_at":"2026-07-04T01:29:21.819712Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.emnlp-main.303","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Diagnosing the first-order logical reasoning ability through logicnli, in: Proceed- ings of the Conference on Empirical Methods in Natural Language Processing, pp","venue":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing","work_id":"bf41ede6-3eda-43d3-ba1a-87285ed0c9cb","year":2021},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0216dd58a0e78c997f5f5da53e2eb7ef07990430b3ba4cb6a3147abc8db62f59","observation_id":"02b26877-f7f0-42f2-976f-8c3b70984598","resolution":{"observed_at":"2026-07-04T01:29:21.769610Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.115468Z","title":null,"venue":null,"work_id":"ad8749d5-ba45-4d86-a956-71dbecee159d","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:7e333634a402b856afd965a255e74efa408a14851d8d55f9dff6f5d75634e82c","observation_id":"380caf70-ba8e-454c-9677-989314203926","resolution":{"observed_at":"2026-07-04T22:30:11.013523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.128","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L ogic A sker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models","venue":null,"work_id":"3927f8ed-faae-4c9a-ac32-60d620b17174","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0583ae4e587c27df13f08d946051457eb9b8874647e4c5fb56b6eebb5a45139c","observation_id":"bf604990-9e0c-4f85-abab-2e391aac99a9","resolution":{"observed_at":"2026-07-04T01:29:21.756880Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.111909Z","title":"Self-consistency improves chain of thought reasoning in language models, in: The Eleventh International Conference on Learning Representations","venue":null,"work_id":"92953955-4585-4322-b276-946413d26eaf","year":2022},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:3004464e8627d966cde8a431180a57e8cd57d0ab1ae3bf23fd41eb44d8194e96","observation_id":"b3bc9a1d-3a94-4f74-9417-c615b97c96b3","resolution":{"observed_at":"2026-07-04T22:30:11.023768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.110069Z","title":"Chain-of-thought prompting elicits reasoning in large language models, in: Proceedings of the International Conference on Neural Information Processing Systems, pp","venue":null,"work_id":"9f50d5f5-96d0-41ae-90e7-ccb4f111f41d","year":2022},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:6a8f42679ac28ce978bb4d179a114a848fbebe48c6c6a735ef6b0250f6639d4c","observation_id":"19c14d6e-f270-43ce-8b49-a1f8f0a7d988","resolution":{"observed_at":"2026-07-04T22:30:11.002217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.360120","doi":"10.1109/access.2025.3601206","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A systematic literature review of hallucinations in large language models","venue":"IEEE Access","work_id":"6a905d5b-456a-4eb2-a34b-da1effac713f","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:d03d232837ad5915c872a916ffb92d7c0b2b14b5d755c21d43d2291537d8ea83","observation_id":"be7b517e-a2dd-446d-8b21-15534da6753f","resolution":{"observed_at":"2026-07-04T01:29:21.800900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715784","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Detecting and reducing the factual hallucinations of large language models with metamorphic testing","venue":"Proceedings of the ACM on software engineering.","work_id":"960314c0-e938-402b-aec0-c100d28c5cdd","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:6b583b194e6d959a1f225934981546e00045ac7aba2c2e3eae472ec482b32d91","observation_id":"b3f56e49-bdfc-4f91-a37f-677e22296d41","resolution":{"observed_at":"2026-07-04T01:29:21.781952Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.113780Z","title":"Testing and validating machine learning classifiers by metamorphic testing","venue":null,"work_id":"7d4c33ff-fc83-4eb9-920d-8fb8417f9e52","year":2011},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:876312110a9f45c8c6170c450f07b04d4033f6eabaf9611c025d4192a5791ec2","observation_id":"3f7ff43d-132b-46d7-abed-247cf581fe40","resolution":{"observed_at":"2026-07-04T22:30:11.026338Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.353600","doi":"10.1109/tkde.2025.3536008","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are large language models really good logical reasoners? a comprehensive evaluation and beyond","venue":"IEEE Transactions on Knowledge and Data Engineering","work_id":"7a1050a1-6000-492e-b3b0-a9f754b7d6f5","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:8afc5ce32bb7732ce9dc671a045ca576f0c184c1a89a0c965369505af0363cbf","observation_id":"9f84d98f-c6a6-48a2-a632-d19753b3573e","resolution":{"observed_at":"2026-07-04T01:29:21.742406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0db18b33673898e609006b8f3ef2d35f7e2a8c5900d96b7468a40f87efd771ad","observation_id":"3732a0e4-37ef-43f7-948a-ee90bf729cdc","resolution":{"observed_at":"2026-07-04T01:29:21.760196Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.148601Z","title":"Hal- lucination detection in large language models with metamorphic relations","venue":null,"work_id":"06767222-f2ec-4242-8f9d-38de3590906b","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:41f61bfc7fc930d7f1a1d161ff1aa22493ee8c133279d43d07138a2d9f932069","observation_id":"83d93925-478d-4b5d-b2ce-c27805ddb658","resolution":{"observed_at":"2026-07-04T22:30:11.038349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22250","doi":"10.48550/arxiv.2512.22250","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hallucinationdetectionfor llm-based text-to-sql generation via two-stage metamorphic testing","venue":"arXiv (Cornell University)","work_id":"159db917-8617-4a74-8952-608cd047e791","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:3320ddf2d15d0d4167c32b96c6a162a7ea1fc97f81a8f2f441fcb2652669d83d","observation_id":"abd913fb-f043-4d25-97ef-adfad4415ac1","resolution":{"observed_at":"2026-07-04T01:29:21.797634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04326","last_updated":"2020-08-22T07:14:30Z","snapshot_observed_at":"2026-08-19T06:18:57.203156Z","submitted_at":"2020-02-11T11:54:29Z","title":"ReClor: A Reading Comprehension Dataset Requiring Logical Reasoning","version":3},"cited_work":{"arxiv_id":"2002.04326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2002.04326","snapshot_observed_at":"2026-07-04T01:29:22.065832Z","title":"arXiv preprint arXiv:2002.04326 , year=","venue":null,"work_id":"ff2862dd-bdcd-498c-afc1-d29368bb9626","year":2020},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2002.04326","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:1939c832fa9540b28fba9c55856c96d7cce70e3043e9c19a08a0631aeb16d7dd","observation_id":"21f4fbcb-3ce6-4d11-88c8-564b8f49ce22","resolution":{"observed_at":"2026-07-04T01:29:22.067780Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19213","last_updated":"2025-03-24T23:39:44Z","snapshot_observed_at":"2026-08-19T10:00:46.187544Z","submitted_at":"2025-03-24T23:39:44Z","title":"A Survey of Large Language Model Agents for Question Answering","version":1},"cited_work":{"arxiv_id":"2503.19213","doi":"10.48550/arxiv.2503.19213","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19213","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey of large language model agents for question answering","venue":"arXiv (Cornell University)","work_id":"89310441-e965-4151-95d1-b297f1c89712","year":2025},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2503.19213","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:26f50a3d5ae1ac48e9063001b1a132cd68250cc2fb941d11c3852665089887ce","observation_id":"b83b8d35-db3a-4ec7-a384-4879c1534017","resolution":{"observed_at":"2026-07-04T01:29:21.804812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.146894Z","title":null,"venue":null,"work_id":"77ede38e-ad6c-4c68-b725-59bebb5ed701","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:b1a844df83534475c69b6a5a1bfba171128017c03f67453183d58ec4faf9b58b","observation_id":"9e1e57e0-b856-4fc0-9400-cc06b9d86b74","resolution":{"observed_at":"2026-07-04T22:30:10.967496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.363703","doi":"10.1109/tpami.2025.3637037","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From system 1 to system 2: A survey of reasoning large language models.IEEE Trans","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"8fdbc1cc-99e2-437d-b623-5b4222975439","year":2026},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:9edc0536708eca85f95857d1ef208b0ed9d20528d918c833b25da97bf274e541","observation_id":"9956994b-9f2c-4558-a83a-d3a6aa8d7f92","resolution":{"observed_at":"2026-07-04T01:29:21.791024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.101973Z","title":null,"venue":null,"work_id":"54b8f8d1-3d43-4b25-a1b3-19e89716a270","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:3ec17868657001c745228bd8f7887181f4c60dbb5c3549587d8f73e306e96b90","observation_id":"7f5945d8-1ede-4078-89c4-2905ac3df064","resolution":{"observed_at":"2026-07-04T22:30:10.979695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-16T05:27:41.446467Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":"2205.10625","doi":"10.48550/arxiv.2205.10625","metadata_source":"pith","pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","venue":"cs.AI","work_id":"7e58c111-4666-4996-b5ad-1c8efd433083","year":2022},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:c6e998e54117500f1270dd68d0d847448c4cb7a9dec98bd14d48a853e27f9bfa","observation_id":"c5f17d58-c272-416b-95de-72b47ca8d5c6","resolution":{"observed_at":"2026-07-04T01:29:21.813060Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.103627Z","title":"Toolqa: A dataset for llm question answering with external tools","venue":null,"work_id":"ebf7c4cd-0c11-4b0d-a2b9-b42cb0875219","year":2023},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:3aa1a1a093108aba93147e86619381ee5c9dc4212189f178d658df346f17ecf6","observation_id":"69b1aff6-d1b6-4e63-861f-847b6958c78a","resolution":{"observed_at":"2026-07-04T22:30:11.026957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.106860Z","title":null,"venue":null,"work_id":"1d054934-9518-431f-9177-688122fca55f","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0576731f2908ef4a358e1375352c53220fbf3341f0dd416e566a294755153123","observation_id":"85edcce7-d95e-47ac-b407-f09206245b63","resolution":{"observed_at":"2026-07-04T22:30:11.024340Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.105375Z","title":"Conclusion Tom is a citizen of Washington","venue":null,"work_id":"15d8cc25-f863-40c3-8840-6538ee23d44c","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:4130a687ef5e6b90eda83c3199782bfcebfe8f13a6e77029f1bc9c686399e6de","observation_id":"7ef1f811-ff52-4f55-a59c-215fd071bb9b","resolution":{"observed_at":"2026-07-04T22:30:11.013535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.108384Z","title":null,"venue":null,"work_id":"9834cd3a-e8d8-47af-9ad0-28f2bbf83af2","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:f64715b7eaafc78f4be539647a54112c01b018d16472afaf9b299da6aa15ca4f","observation_id":"3253b911-d670-4b60-96e1-83c225d1b38f","resolution":{"observed_at":"2026-07-04T22:30:11.049604Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.095536Z","title":null,"venue":null,"work_id":"028b3727-4639-4615-9301-5c73c37e6955","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:0f19b660eb52d69e05d98a99ec591e245cb26b0b15d3f646fedd8769a7220cb5","observation_id":"01205fd1-49a3-451d-ac17-135c533e52e7","resolution":{"observed_at":"2026-07-04T22:30:11.034060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.097223Z","title":null,"venue":null,"work_id":"c0030550-b9bc-4316-b8fb-ea01fb52946f","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:f0cf4ba28ff05befdee4a06e7302f8015f00e69be001b55ab6a2bba0f21461c4","observation_id":"d2dd9d6a-8e58-4a87-bec2-4c5227f500cc","resolution":{"observed_at":"2026-07-04T22:30:11.008064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.098791Z","title":"Conclusion Tom is a citizen of Washington","venue":null,"work_id":"e9df377e-aef8-414d-812e-9fb388608144","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:a3ed6d8facb33ab9ef2421cd79b3532f75d6eb5d2bd32d4a46bb9ee9f21da06a","observation_id":"77e38a68-47dc-422f-b674-710f23379cde","resolution":{"observed_at":"2026-07-04T22:30:11.043102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.092040Z","title":"label\".↪ The value for","venue":null,"work_id":"a93dc9df-575f-4f4d-87b7-86d970212a33","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:de76987822e5bc1a588131ff154b8178819ad05cb0a517232043259f03febb03","observation_id":"cd7bfd97-dd3e-4308-937d-d9881dac4ae0","resolution":{"observed_at":"2026-07-04T22:30:10.910976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.088631Z","title":"reasoning","venue":null,"work_id":"32d62301-324a-4bc2-a406-56f9dc9ef681","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:498c28fc9d98b0795e3e313551876e6308c26c91cb7ecf30d4af5a3df874a877","observation_id":"82ae885e-8989-42a1-8258-ff64b9b769e1","resolution":{"observed_at":"2026-07-04T22:30:11.000222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.085152Z","title":"label\".↪ The value for","venue":null,"work_id":"73125b1a-56f4-4153-8bc4-c4f280adb974","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:2252da62441b4a11a0f332e6260fd96096038bd107daa7fcc03acb7b11ca5738","observation_id":"6a0f9444-211f-44b3-8d51-7b24f87d9a65","resolution":{"observed_at":"2026-07-04T22:30:10.913685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.086855Z","title":"Your evaluation must rely strictly on formal logical structure","venue":null,"work_id":"93e6e7bb-cd63-4a30-a414-9d324534451f","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:39799c9290e8c5bc95a275fa53faff9ab4071f4411545b6cac7f8c8ff9d3e3ae","observation_id":"000b52ca-ca4c-4e2f-b62c-9c349291779d","resolution":{"observed_at":"2026-07-04T22:30:11.039830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.090137Z","title":"reasoning","venue":null,"work_id":"6a53b157-d6f6-4991-8a45-0e4920b45081","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:717f557fdcce3ed88d348cae83df8a69e3609184bf08f72b22c0fd9d7ea9d3a8","observation_id":"8c24ea4c-f861-45f9-98a6-055f733af53a","resolution":{"observed_at":"2026-07-04T22:30:11.010621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.093755Z","title":"both A and B","venue":null,"work_id":"aa9bd0da-e2a1-4f4c-893f-05cf6f3ba36d","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:01c7069d02981ab0aad4658191a06e73534ed31d1e3b1298d757a48be30db36d","observation_id":"2e6c7f7b-d62c-491d-a62a-f060daf60f3f","resolution":{"observed_at":"2026-07-04T22:30:10.950732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.100411Z","title":"Jadiel is Bitter","venue":null,"work_id":"69e1ff26-e5da-42c4-8463-0765b278376f","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:6b990b57ab75fc8c9f4ce46d9122cd65b1ad4b472f1874a94a127453d871afe7","observation_id":"60127795-46bd-4943-b75f-3a2668a4379c","resolution":{"observed_at":"2026-07-04T22:30:10.976511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.078425Z","title":"For all x,","venue":null,"work_id":"5fbf4338-8ddf-4501-baba-da5658627c4c","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:4abb126873e3168a62680b55c2c418f7757a9641ed80cbbc1b200c9c04342158","observation_id":"a4633576-4bee-4101-a7db-2592a12c1230","resolution":{"observed_at":"2026-07-04T22:30:11.015843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.079963Z","title":"it is not the case that it is not the case that A","venue":null,"work_id":"0e06fd00-2484-44f6-9004-045fade6d111","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:fe77d063862ae208c6ba3f2482966b63cc3c7ace75d6287217abe74cd6432fcd","observation_id":"1a85ccb8-eeeb-4134-908c-ffafc99f4e71","resolution":{"observed_at":"2026-07-04T22:30:11.037419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.081667Z","title":"- AND (&), OR (|), implication (->), and biconditional (<->) must be preserved.↪","venue":null,"work_id":"33aa3412-f15a-45ca-a6c2-c86d72f8455b","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:826b33bc7b47fbb99a948d431dc0348fae9fce49f03f1f86ce5470a466ed8df4","observation_id":"e0775d88-1763-4823-a7fb-59e0bccf95d9","resolution":{"observed_at":"2026-07-04T22:30:11.020033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.075170Z","title":"- Pay close attention to negation scope","venue":null,"work_id":"afe738d6-8c58-4e48-b3d1-68331f3f3652","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:ebb6ea08cd9f0823a48b1e8943df397d4324bacc0e8567fdab5feb66502aa6ed","observation_id":"813bd88e-4e8b-4e0b-a06a-ab2d0651e585","resolution":{"observed_at":"2026-07-04T22:30:10.916778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.071656Z","title":"- Do not swap universal and existential quantifiers","venue":null,"work_id":"5533072a-96e5-4f33-84f7-9ea7c97cf5a3","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:006419f06381c9c2575779a2ab25f0dfe62380ec7297f836e60a19b335caa174","observation_id":"ba2d1349-3528-466a-94e0-8a4483609312","resolution":{"observed_at":"2026-07-04T22:30:11.041305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.076830Z","title":"- Keep predicate/relation identity and argument order","venue":null,"work_id":"798a60d4-63b1-4b88-9b80-5e0bd7ccd353","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:ebe2eb4889b3d065e3827cb3e3416385281cb18ce04279e804397d767236e9cf","observation_id":"06a0bdd6-6a32-4ec6-82ed-3e2c8d144191","resolution":{"observed_at":"2026-07-04T22:30:10.937285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.083473Z","title":"- Do not replace placeholder symbols such as Pre1 or Con1 with guessed original meanings.↪","venue":null,"work_id":"1a340932-83dc-4ef8-924d-4421a021389d","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:283571e761e65a46984ea12784c3ba904e5a249fbf67beeac66d29bf34db5f32","observation_id":"8d840226-1bdd-4e3f-a094-9caea48d114b","resolution":{"observed_at":"2026-07-04T22:30:10.995763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:33:55.069847Z","title":"False\".↪ If the NL sentence faithfully preserves the FOL structure, return","venue":null,"work_id":"d8159f81-a1ad-41ab-8ef8-ca434f59e250","year":null},"citing_paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-04T01:22:59.320550Z"},"links":{"citing_paper":"/paper/2605.23965"},"observation_digest":"sha256:ed9aca8f80970ac7a7c13587be018fddd10549023171fc0fb82a9c778976f0a1","observation_id":"0846755d-3cad-48cf-a7bb-34160c4d77c6","resolution":{"observed_at":"2026-07-04T22:30:10.944087Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23965","last_updated":"2026-07-02T09:53:28Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T20:04:38.014275Z","submitted_at":"2026-05-12T18:26:59Z","title":"LGMT: Logic-Grounded Metamorphic Testing for Evaluating the Reasoning Reliability of LLMs"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":5,"metadata_mismatch":14,"parse_uncertain":0,"unresolved":13,"verified_exact":24,"verified_fuzzy":30},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2605.23965."}