{"as_of":"2026-08-22T11:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70a52dd78b989ddf5a5702ba8a7531cba94a768b3eeb8fa5ce5a4a93dfd87587","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:48:58.571640Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:31:24.935640Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:31:24.994128Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":"2607.13248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.13248","snapshot_observed_at":"2026-08-15T15:31:24.994128Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","venue":"cs.CL","work_id":"1f53d322-0528-4bbb-a9cb-7e0b151cb8d4","year":2026},"citing_paper":{"arxiv_id":"2607.22859","last_updated":"2026-07-24T19:01:17Z","snapshot_observed_at":"2026-08-20T16:19:42.354721Z","submitted_at":"2026-07-24T19:01:17Z","title":"PatiGonit22K: A Comprehensive Dataset for Solving Complex Bengali MWPs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:31:24.935640Z"},"links":{"cited_paper":"/paper/2607.13248","citing_paper":"/paper/2607.22859"},"observation_digest":"sha256:526a0bc3f51b53e3ad0998a5e1693367402d7feb855d7f46eafbe58a45a46393","observation_id":"d4906a80-fc8d-498c-a0e3-e0aed751b58a","resolution":{"observed_at":"2026-08-15T15:31:25.001382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13248/citation-record","integrity":"/paper/2607.13248/integrity","json":"/paper/2607.13248/citation-record.json","paper":"/paper/2607.13248"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T05:48:47.190993Z","title":"Training veriﬁers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.190993Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8085e47e46753ed5cab2d8002de684fb7d5126f6416aa5e9ad7d0b9c2cf5463b","observation_id":"7bce190b-adc0-4c98-a513-006763232a2e","resolution":{"observed_at":"2026-08-02T05:48:47.190993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-02T05:48:47.276280Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.276280Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:53e71427262c9a489356d775f8b2e82f27012ff04aea4892f7bec4d510a3013f","observation_id":"63d763d1-33f7-46c5-843d-8f4f2530a870","resolution":{"observed_at":"2026-08-02T05:48:47.276280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:47.439348Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.439348Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:fcd6468030fb3cb4e16ca00c41b21b610824d2b9febb5e63424c2fe446d097ce","observation_id":"40f49a4d-4e4f-4ead-97be-60958143c626","resolution":{"observed_at":"2026-08-02T05:48:47.439348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-02T05:48:47.604661Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.604661Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:998aea8b1ab26a120d78ff9dc0096067044f7bacdeff6d448efaec63182ff637","observation_id":"ab9e9de5-1d85-482b-be45-783fb80fc3e1","resolution":{"observed_at":"2026-08-02T05:48:47.604661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-02T05:48:47.775905Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.775905Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:4edcd1adfd348b158342a2f60731f38b818f643b09c39f17adb0011e9f783191","observation_id":"4fbfb4ab-2f67-4b35-8a1e-54b9f7795e5b","resolution":{"observed_at":"2026-08-02T05:48:47.775905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:47.909087Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:47.909087Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bb58563691b9e5d1f0bd85ef5406b04e25e9f1403dc7cd93baddc2ecd799e9be","observation_id":"2be025c6-5f38-4f05-9030-348c7d9a48ce","resolution":{"observed_at":"2026-08-02T05:48:47.909087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:48.095647Z","title":"Lampinen, Ishita Dasgupta, Stephanie C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.095647Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:1ec4556b6f6bd3738cb142333748079fef6772dfc678a58022a4995c793cba90","observation_id":"e2530934-3214-4a28-ac35-0782901d0a2d","resolution":{"observed_at":"2026-08-02T05:48:48.095647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:48.305628Z","title":"Evaluating mathematical reasoning of large language models: A focus on error identiﬁcation and correction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.305628Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:5210bac5044336e0b46f306cf318019c5b5e74ecd71f7f523a8f393f75146ab4","observation_id":"9a0cef49-b2c0-4af0-b46a-7ce90c5869e8","resolution":{"observed_at":"2026-08-02T05:48:48.305628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:48.409446Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.409446Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:1a8f32e92af88920c4e40e47e492b8c383979c79e2e0808ae370be43543e9243","observation_id":"4592e1e0-2d16-49d4-abe5-723a21cc7b1e","resolution":{"observed_at":"2026-08-02T05:48:48.409446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:48.610512Z","title":"Mathify: Evaluating large language models on mathematical problem solving tasks, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.610512Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:373fb03716ea81470a4d2ab483f353485c44d026ffcc215c4217cecafa091ef0","observation_id":"a6df44a5-3b0d-4201-96e5-ec60be9f6360","resolution":{"observed_at":"2026-08-02T05:48:48.610512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-08-21T02:25:44.454471Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-02T05:48:48.762081Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.762081Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:6e38f4c434236d9e020ee75be501ed4ac89a5cea2be0a1937e05c5dfb0ee6629","observation_id":"1c9328e9-4903-4205-b70b-77bec0f5b6ea","resolution":{"observed_at":"2026-08-02T05:48:48.762081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:48.942078Z","title":"Benchmarking in-context learning strategies of large lan- guage models for math reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:48.942078Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:3bd4a00f9e691a9b258c5cd79a38c30c8bb0d9b382615186f03aaf265662c7ea","observation_id":"83a612ed-45d0-4109-9621-4a37230ec241","resolution":{"observed_at":"2026-08-02T05:48:48.942078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:49.107551Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.107551Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:d0c54d7fc559907d14df5a723f02c82d3f2eedf5c15196edc24eba23961380c1","observation_id":"3e52db02-361b-4445-a234-4321c9799b42","resolution":{"observed_at":"2026-08-02T05:48:49.107551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10839","last_updated":"2024-12-19T15:25:41Z","snapshot_observed_at":"2026-08-16T13:25:12.505729Z","submitted_at":"2024-08-20T13:34:17Z","title":"Benchmarking Large Language Models for Math Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10839","snapshot_observed_at":"2026-08-02T05:48:49.307485Z","title":"ozl¨\"ukl¨","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.307485Z"},"links":{"cited_paper":"/paper/2408.10839","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f24be62861e20a7a45caae4bf4612a063d97acc7e2a7e14bb9ff81de51e46731","observation_id":"6036ef5c-4d9f-4230-892a-109d6ee7d315","resolution":{"observed_at":"2026-08-02T05:48:49.307485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:49.448507Z","title":"Lila: A uniﬁed benchmark for mathematical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.448507Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:293e4207760562325bbca4d7da02cea74b55393a1a08ea4e758759a0d11df48b","observation_id":"4756a493-e589-482f-bdb1-fd70f81a5178","resolution":{"observed_at":"2026-08-02T05:48:49.448507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:49.589809Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.589809Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:0fbdd3c0c5da2451158fc3e40b279fe9234fa46a76ea92233517399f637587e0","observation_id":"eaf2dbb9-3575-4377-a92a-3ce96e527b01","resolution":{"observed_at":"2026-08-02T05:48:49.589809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:49.748099Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.748099Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:80924a4725df55a75c197ec886d84fe1ee5cdb6f854a22342080131aa27516ea","observation_id":"8e901685-b5f2-441e-9668-87c3b1e7cc58","resolution":{"observed_at":"2026-08-02T05:48:49.748099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:49.892122Z","title":"Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai, 2025","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:49.892122Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:d09ddd512ec7787fe9dce6713fa606eca790e720af15b9347d98e74401da1196","observation_id":"73f688c5-7310-4a74-a238-526dc0661efe","resolution":{"observed_at":"2026-08-02T05:48:49.892122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-02T05:48:50.008979Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.008979Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:ceb6021c1d313c8a0a7c495c123691f22517e325b9790c84e484dd0ebd1229f3","observation_id":"26c5fce6-9cdd-450f-8990-06621c28cd78","resolution":{"observed_at":"2026-08-02T05:48:50.008979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:50.166797Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.166797Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8ea6a01fea01223a1fe77554e2051954f60337a9248dddafc95a469113bad5a7","observation_id":"c5525a8a-1a30-4f71-aa23-f6427d7e39c3","resolution":{"observed_at":"2026-08-02T05:48:50.166797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:50.315864Z","title":"Dynamath: A dynamic vi- sual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.315864Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f0bb47d262234d6e5717eccfaca2740fa0f3f840d031a2a4dc68d07631cff081","observation_id":"0a3f7f6f-6947-4bae-ad36-5ddd12773e8d","resolution":{"observed_at":"2026-08-02T05:48:50.315864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19255","last_updated":"2024-07-02T03:46:03Z","snapshot_observed_at":"2026-08-18T20:34:01.378931Z","submitted_at":"2024-02-29T15:26:14Z","title":"GSM-Plus: A Comprehensive Benchmark for Evaluating the Robustness of LLMs as Mathematical Problem Solvers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19255","snapshot_observed_at":"2026-08-02T05:48:50.502614Z","title":"Gsm-plus: A comprehensive benchmark for evaluating the robustness of llms as mathematical problem solvers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.502614Z"},"links":{"cited_paper":"/paper/2402.19255","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:edb02133d33c49b6c52f8ef4d7585270450ceed407f29f687a9ec28d80081be7","observation_id":"7dee0196-0d50-4c69-8992-8c15a07ff5f6","resolution":{"observed_at":"2026-08-02T05:48:50.502614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:50.680645Z","title":"Evaluating robustness of llms to numerical variations in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.680645Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:0a273e17dab2c413a639c5f4e98119595ed3448f97d7b2dd32431a2da1f25303","observation_id":"505620ff-c7c7-4194-8c7d-3e98fbb3765e","resolution":{"observed_at":"2026-08-02T05:48:50.680645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:50.802411Z","title":"An investigation of robustness of llms in mathematical reasoning: Benchmarking with mathematically-equivalent transformation of advanced mathematical problems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.802411Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:cb81d6c628ca243d43a4065d8067a9cdf486cba8660b37b0f21fc9daf6f0f164","observation_id":"2999396e-1f59-4047-8fbe-f9e154466d78","resolution":{"observed_at":"2026-08-02T05:48:50.802411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:50.943635Z","title":"Robustness in large language models: A survey of mitigation strategies and evaluation metrics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:50.943635Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bcfcedf68d0516e92ac3b7574a209771bda30fa3cb55e168b24664546889b331","observation_id":"7b2decfb-6133-4160-b4af-e2b58ff08b91","resolution":{"observed_at":"2026-08-02T05:48:50.943635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.056352Z","title":"A novel metric for measuring the ro- bustness of large language models in non-adversarial scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.056352Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f2f38a0b48de246cf63ddb6636766d6af0d70135a9c648393bb1fd111cdc2054","observation_id":"4f0245c0-cc4b-4706-923f-d4535319a498","resolution":{"observed_at":"2026-08-02T05:48:51.056352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.233717Z","title":"Do large language models understand their knowledge? AIChE Journal , 71(3):e18661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.233717Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:7f6481c4d0d3410b7399336ddf73641700ab5f4c1c603416b170db8543132672","observation_id":"a94dbcb5-9fe2-4e1a-a596-8c2c6fdf9920","resolution":{"observed_at":"2026-08-02T05:48:51.233717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.340082Z","title":"Is your model really a good math reasoner? evaluating mathematical reasoning with checklist","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.340082Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:d707079760d905450d95a72b48dcd4a73c9773017d8f8d86c7aa4e879a382b81","observation_id":"c89bc803-1387-448f-ad87-9b1b577e8b9d","resolution":{"observed_at":"2026-08-02T05:48:51.340082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.474683Z","title":"Bhaasha, bhas","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.474683Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8ec80904892a93c75e18d69603dd632eab6825f5b98e13a95eb5e1a174d8d4c5","observation_id":"95e1fa83-4c96-45be-980c-41b8312ffafb","resolution":{"observed_at":"2026-08-02T05:48:51.474683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.573597Z","title":"Llms for low resource lan- guages in multilingual, multimodal and dialectal settings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.573597Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:c2e743b235cfdd9b96febd1a31c4669b8c9d05a536715ecaefa204ca1c7b8b48","observation_id":"abea8591-ebd7-4900-8bf2-9265e2288696","resolution":{"observed_at":"2026-08-02T05:48:51.573597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.657980Z","title":"Natural language processing applications for low-resource languages","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.657980Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:c0845fb2d5f2700977dcc94f58d0e8b9d7a0a083cc9558655a8d4b0d44a9a04e","observation_id":"31f71879-3b2c-4193-a966-5ad0300d72b5","resolution":{"observed_at":"2026-08-02T05:48:51.657980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13930","last_updated":"2026-06-07T23:23:21Z","snapshot_observed_at":"2026-08-20T23:30:25.790351Z","submitted_at":"2025-09-17T12:58:18Z","title":"Linguistic Nepotism: Trading-off Quality for Language Preference in Multilingual RAG","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13930","snapshot_observed_at":"2026-08-02T05:48:51.805431Z","title":"Linguistic nepotism: Trading-off quality for language preference in multilingual rag","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.805431Z"},"links":{"cited_paper":"/paper/2509.13930","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:a979d133dd296d5ece077f691ce73677c9bc362e6631d0f5cf414bd5668fbafe","observation_id":"204bd9ac-a1ea-499e-85f5-2e5f9d1a7407","resolution":{"observed_at":"2026-08-02T05:48:51.805431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:51.946286Z","title":"Bengali language — Wikipedia, The Free Encyclopedia","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:51.946286Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f722b3dc4f0ec7aa587d08d78f8ddf7e3f48cf56e3a62527de36222eebf064e5","observation_id":"b7fc5b32-edec-4ab3-8a22-ac84241fb9fe","resolution":{"observed_at":"2026-08-02T05:48:51.946286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03816","last_updated":"2025-05-02T17:41:17Z","snapshot_observed_at":"2026-08-18T03:28:38.861585Z","submitted_at":"2025-05-02T17:41:17Z","title":"Geospatial and Temporal Trends in Urban Transportation: A Study of NYC Taxis and Pathao Food Deliveries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03816","snapshot_observed_at":"2026-08-02T05:48:52.098465Z","title":"Geospatial and temporal trends in urban transportation: A study of nyc taxis and pathao food deliveries","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.098465Z"},"links":{"cited_paper":"/paper/2505.03816","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:b1c8afa27a98368964821926dab115a5c048735af034f163947b952d9ec8dab2","observation_id":"25e33802-b0c3-4150-9b8b-0345c0334975","resolution":{"observed_at":"2026-08-02T05:48:52.098465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.247263Z","title":"Banglamath: A bangla benchmark dataset for testing llm mathematical reasoning at grades 6, 7, and 8","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.247263Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:238d5d6dcdc43de37d62046cdab8d389b707a1f09f19b5bc693cad720b6d648f","observation_id":"466d3e7a-5760-4936-8948-056b027cddcf","resolution":{"observed_at":"2026-08-02T05:48:52.247263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21354","last_updated":"2025-07-30T03:20:16Z","snapshot_observed_at":"2026-08-19T23:19:10.807035Z","submitted_at":"2025-05-27T15:47:10Z","title":"Leveraging Large Language Models for Bengali Math Word Problem Solving with Chain of Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21354","snapshot_observed_at":"2026-08-02T05:48:52.372383Z","title":"Leveraging large language models for bengali math word problem solving with chain of thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.372383Z"},"links":{"cited_paper":"/paper/2505.21354","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:18b18f9e7823705a1a0684a28113691d95fdb71e63a0fb9a6aaedb569fe3a3c1","observation_id":"c627aa7e-3546-45aa-901f-aea399da88e1","resolution":{"observed_at":"2026-08-02T05:48:52.372383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.494430Z","title":"Ganitllm: Difﬁculty-aware bengali mathematical reasoning through curriculum-grpo","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.494430Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:b3c44d5d6435eca32ea9bec0e268fccf50361ae6a89aa678c05aa5fe696981b8","observation_id":"e5717357-f1b7-4d2d-a034-19802bbad25c","resolution":{"observed_at":"2026-08-02T05:48:52.494430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.601585Z","title":"BanglaBERT: A large-scale language model for bangla","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.601585Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:a1f41b108f6e085be5c342f78ab8dff19a73d4cd8ec6efd67514e8ad67bc1e21","observation_id":"6ff1017c-d4e7-49e5-bc00-a778c80bfa1c","resolution":{"observed_at":"2026-08-02T05:48:52.601585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.691619Z","title":"BanglaBERT-Base: A smaller model for bangla NLP","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.691619Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:e62215d9e3d754a48ee3edc4000d7be57f51293ff47fdbbfde25267ee2ee9a88","observation_id":"aec5dda4-e2af-4c5a-adb5-69f01d517f08","resolution":{"observed_at":"2026-08-02T05:48:52.691619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.815611Z","title":"Xtreme: A mas- sively multilingual multi-task benchmark for evaluating cross-lingual generalisation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.815611Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:fd782cee530aaa231c38e7afe1cec1b404027380adb0cc168b1e9c3bc0cd0ee0","observation_id":"f6fd5a36-933e-419a-acb4-4ebadd4d0d1b","resolution":{"observed_at":"2026-08-02T05:48:52.815611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:52.927498Z","title":"XGLUE: A new benchmark dataset for cross-lingual knowledge graph construction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:52.927498Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:3142622a9c44a2fa0e7e4c33f9732e9fe9a2e6ccf96e2400865d29387da9ecd2","observation_id":"c8780b91-41bd-4b4e-9fac-39d5bbb6ec40","resolution":{"observed_at":"2026-08-02T05:48:52.927498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:53.039838Z","title":"Breaking language barriers in mul- tilingual mathematical reasoning: Insights and observations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.039838Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f9a69f19d00ae1f0f2274ef69fc8ca112ebe901367655d20b1d8b64d3d6b04dc","observation_id":"c0b752c0-e67a-495f-9ef4-7e9d299b519e","resolution":{"observed_at":"2026-08-02T05:48:53.039838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:53.140170Z","title":"BanglaNER: A named entity recognition dataset for bangla","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.140170Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:0ab87211261d5ecca08b9463f5c77211b1d16054a8fe213ba8a5feec4b8e1baa","observation_id":"1db08267-cdb3-492d-946b-0edbf9ccef9c","resolution":{"observed_at":"2026-08-02T05:48:53.140170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:53.271273Z","title":"Bnmmlu: Measuring massive multitask language understanding in bengali","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.271273Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8f41cdb71703627d8f49315345e7c897983e42bac1a5ff7f34089fbcc97977a7","observation_id":"5a3a1306-8684-4f24-a26b-39bdd8275269","resolution":{"observed_at":"2026-08-02T05:48:53.271273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:53.433383Z","title":"MathQA: A dataset for mathematical question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.433383Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:ff98f25fa5da03dc901a67532d17b5a2e17869467015bef3e196f09efcc64ca5","observation_id":"c7b9c5bf-13fa-4790-9cc5-bfd9034e4696","resolution":{"observed_at":"2026-08-02T05:48:53.433383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T05:48:53.614538Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.614538Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:eca1b06a5d2423ee643f7bfbfd94714cf30d09144da33e67a72d5536cccac1f6","observation_id":"1833ce5b-fdc2-49d4-afc1-004c6d66a705","resolution":{"observed_at":"2026-08-02T05:48:53.614538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-02T05:48:53.804306Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.804306Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bbc0233ee26036ecd3eda7d0b5cff8fdfd33f7ac54126a751e5b949f35546f3e","observation_id":"89f4b833-b3dc-45e4-a54f-21399982ed24","resolution":{"observed_at":"2026-08-02T05:48:53.804306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T05:48:53.921488Z","title":"Llama 2: Open foundation and ﬁne-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:53.921488Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:0916a253bf10801ff395371b061938041909eb20d830f19713f3bcdce7ac501d","observation_id":"aa08cc3f-3280-48d9-92f1-a344a9f85664","resolution":{"observed_at":"2026-08-02T05:48:53.921488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-02T05:48:54.030331Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.030331Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f1dc049ebfd6cb987f3ca69bae51467bab4eefac7f56524f05a277c7d6ea60d4","observation_id":"8fc7011d-9030-4487-95c9-fda1fd4036b3","resolution":{"observed_at":"2026-08-02T05:48:54.030331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.156413Z","title":"Evolution of meta’s llama models and parameter- efﬁcient ﬁne-tuning of large language models: a survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.156413Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:c781f6917951c4056f416f0216d9085fe5bb95df628ab895235290462b2929b9","observation_id":"5c2d37a6-77b7-4512-a6d7-854d1ce5014d","resolution":{"observed_at":"2026-08-02T05:48:54.156413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-02T05:48:54.250857Z","title":"gpt-oss-120b & gpt-oss-20b model card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.250857Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:570f9af9e451d0d92a1f6c844a2423d6dea5fadc45ef818c18788fd4e073b6ad","observation_id":"29b098e4-9e7f-409a-848b-759e17fa518c","resolution":{"observed_at":"2026-08-02T05:48:54.250857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.358479Z","title":"Large language models are zero-shot reasoners, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.358479Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:ee60562c203bda35ddf07a27bf7fa325aa404d4085764c2b873d61180acea23d","observation_id":"dcbbdc53-86c7-47ba-b0fe-0d96a133baac","resolution":{"observed_at":"2026-08-02T05:48:54.358479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.413479Z","title":"Towards understanding chain-of-thought prompting: An empirical study of what matters, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.413479Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f3e0fc778ac7d0c1b614f902b1bc3921cd4c8d0e6d68149dbcd14ab835279e69","observation_id":"e7e60d2b-25e7-4dac-bffe-9c7334449653","resolution":{"observed_at":"2026-08-02T05:48:54.413479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.514102Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.514102Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:210c7f0f643eaad2e387c5828d5a4d16ae0917f03c1031d376b744c7b22be752","observation_id":"d4794586-3015-46eb-a7de-b8c97662d436","resolution":{"observed_at":"2026-08-02T05:48:54.514102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05398","last_updated":"2023-03-04T04:43:49Z","snapshot_observed_at":"2026-08-16T15:50:52.123484Z","submitted_at":"2023-03-04T04:43:49Z","title":"MathPrompter: Mathematical Reasoning using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05398","snapshot_observed_at":"2026-08-02T05:48:54.586744Z","title":"Mathprompter: Mathematical reasoning using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.586744Z"},"links":{"cited_paper":"/paper/2303.05398","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:6c82d114c216a274cb29a718713938431a781b9209941f47be5fece29d645fec","observation_id":"9a0da260-5d7c-42e6-80ad-974eadc0fe48","resolution":{"observed_at":"2026-08-02T05:48:54.586744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.655414Z","title":"A survey on large language models for mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.655414Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:39b2689775edb291baee9b91644d7ca18633cbcc488e37ad8f499b902fcfae1a","observation_id":"0663d788-710c-4807-b43b-8b3a30ab33d1","resolution":{"observed_at":"2026-08-02T05:48:54.655414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.739341Z","title":"A survey on large language models for mathematical reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.739341Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:33f498cd51ae7b9037cd359713b495dc5596997a5643e222e179ea781d3df927","observation_id":"d8f98cd7-2f4f-425f-a7e5-a2c0c4012ec7","resolution":{"observed_at":"2026-08-02T05:48:54.739341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.827163Z","title":"Bennumeval: A benchmark to assess llms numerical reasoning capabilities in bengali","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.827163Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8f0577eb3d546dfe1c77265ad21a1c0a7f6ed564cc43bc0fdbb521d4fb52abfb","observation_id":"dac39ad0-9a77-4e66-9591-7c61ce3a4cb3","resolution":{"observed_at":"2026-08-02T05:48:54.827163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.884850Z","title":"Empowering bengali education with ai: Solving bengali math word problems through transformer models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.884850Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:3d89af15ca1872ab3e9da7485c1c5b20bc7b9b3b0623d550f126b13ca4ec130c","observation_id":"954cd7f3-e902-4cef-8814-c3afe9bdf5a0","resolution":{"observed_at":"2026-08-02T05:48:54.884850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:54.948646Z","title":"Bmwp: the ﬁrst bengali math word problems dataset for operation prediction and solving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:54.948646Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:752fd8dacca720a0587e6ac71a216a310220152a04e9588298a876e2fde04a09","observation_id":"f7beae9b-ee7b-449e-8594-0779c3c0d513","resolution":{"observed_at":"2026-08-02T05:48:54.948646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:55.047689Z","title":"Mathmist: A parallel multilingual benchmark dataset for mathematical problem solving and reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.047689Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:23f8e4a56dc889e8e561d6993f98f17ca91367ee345fda57afdfd47cf7aac537","observation_id":"89d8a220-55fa-4335-bcaf-b76e9ae94316","resolution":{"observed_at":"2026-08-02T05:48:55.047689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19887","last_updated":"2025-08-27T13:48:04Z","snapshot_observed_at":"2026-08-12T04:15:00.325095Z","submitted_at":"2025-08-27T13:48:04Z","title":"Bangla-Bayanno: A 52K-Pair Bengali Visual Question Answering Dataset with LLM-Assisted Translation Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19887","snapshot_observed_at":"2026-08-02T05:48:55.126526Z","title":"Bangla-bayanno: A 52k-pair bengali visual ques- tion answering dataset with llm-assisted translation reﬁnement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.126526Z"},"links":{"cited_paper":"/paper/2508.19887","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:860f4e7166886b1652cb236a0fcd282e7a6f541f1d5e7f71cf29ea3d50e695f5","observation_id":"928c4702-3eef-4b53-ad6b-39053625fffe","resolution":{"observed_at":"2026-08-02T05:48:55.126526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13099","last_updated":"2024-04-19T08:45:42Z","snapshot_observed_at":"2026-08-17T11:10:34.521621Z","submitted_at":"2024-04-19T08:45:42Z","title":"Mathify: Evaluating Large Language Models on Mathematical Problem Solving Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13099","snapshot_observed_at":"2026-08-02T05:48:55.261125Z","title":"Mathify: Evaluating large language models on mathematical problem solving tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.261125Z"},"links":{"cited_paper":"/paper/2404.13099","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:1fd0677169c4453eaf227dc84120d0b97e10f672086a893971d9d2b6b79fc435","observation_id":"acdf606c-3787-41c2-819a-35d0beddf705","resolution":{"observed_at":"2026-08-02T05:48:55.261125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04550","last_updated":"2025-03-06T15:36:06Z","snapshot_observed_at":"2026-08-19T22:15:03.482573Z","submitted_at":"2025-03-06T15:36:06Z","title":"Benchmarking Reasoning Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04550","snapshot_observed_at":"2026-08-02T05:48:55.417781Z","title":"Benchmarking reasoning robustness in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.417781Z"},"links":{"cited_paper":"/paper/2503.04550","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:37150b361161da5483da0cde46ec5a206961b5d9aba9930ec93a9a24d6f9aa2d","observation_id":"827760a3-26cf-493a-a2ca-eebe1f86bf14","resolution":{"observed_at":"2026-08-02T05:48:55.417781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-20T16:37:00.586669Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-02T05:48:55.512315Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.512315Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bf97a72c57f1205eae2b2e50bbdcd6dd2be1f87cce784d7d2fb0e7f9e7fe47d2","observation_id":"82436922-1446-4743-a5ef-c6f0eaed9ab3","resolution":{"observed_at":"2026-08-02T05:48:55.512315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02735","last_updated":"2025-05-05T15:37:00Z","snapshot_observed_at":"2026-08-21T08:20:24.515422Z","submitted_at":"2025-05-05T15:37:00Z","title":"FormalMATH: Benchmarking Formal Mathematical Reasoning of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02735","snapshot_observed_at":"2026-08-02T05:48:55.669532Z","title":"Formalmath: Benchmarking formal mathematical reasoning of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.669532Z"},"links":{"cited_paper":"/paper/2505.02735","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:77a753caab40a7e7dbe03803cf958c21bd0c9161c6da80e371482179fc31e2f3","observation_id":"39a75135-f0dc-4add-9c6c-3f4da563e6f2","resolution":{"observed_at":"2026-08-02T05:48:55.669532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:55.820215Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.820215Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:cea205d014a896982a8cd3c6c4423e4eb9a7a6148aa8758b8993c1b3657de702","observation_id":"58c4303a-6199-4dd9-b2a3-cbeaea850670","resolution":{"observed_at":"2026-08-02T05:48:55.820215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:55.930098Z","title":"Polymath: Evaluating mathematical reasoning in multilingual contexts","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:55.930098Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:26cea1114c556cfdc241a73f24db1df3f26ad1d70c993e3a420c1fa2055ef4e6","observation_id":"9b4d95d0-78fe-4469-8085-f4d0a7bc3e70","resolution":{"observed_at":"2026-08-02T05:48:55.930098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:56.046656Z","title":"Mmath: A multilingual benchmark for mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.046656Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:2f52ca6b0b9b9d041e3bf7a92019cb47c17d0b0e3bc2e097bf6bf6820534a898","observation_id":"5531e0cf-a9bf-490c-af53-0bd0060f6645","resolution":{"observed_at":"2026-08-02T05:48:56.046656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:56.207068Z","title":"Matheval: A comprehensive benchmark for evaluating large language models on mathematical reasoning capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.207068Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:6b3e21d423dffef4338adc6cd2bc98194f8b042d98d7471ab4656baa9f63b481","observation_id":"392d09f2-57d7-4d8c-b073-7ba207256783","resolution":{"observed_at":"2026-08-02T05:48:56.207068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-02T05:48:56.362570Z","title":"Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.362570Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:ff3dee68a8d3baa3dcccf8abb24614f9c8b48bba7adc9bf6ef566d474bca3032","observation_id":"b0a54985-5382-4159-81f8-96873230ee51","resolution":{"observed_at":"2026-08-02T05:48:56.362570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:56.517056Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.517056Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:9711752ef495463cfd12ba044bf0cbb383d34a50c591751e22935c923645168c","observation_id":"6120cf10-79bc-42ed-a82a-d685be410383","resolution":{"observed_at":"2026-08-02T05:48:56.517056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-16T13:22:43.390351Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-02T05:48:56.635190Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.635190Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:a91450bde5704d24e3308983db8526f0300def0444a0d870330365f800d86d33","observation_id":"04a3dc8d-ae8b-4a4c-9032-c7bd20109f4a","resolution":{"observed_at":"2026-08-02T05:48:56.635190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T05:48:56.792230Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.792230Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:d2265cad6108e3231073fbeeecf3657488e155898cd21259553b9a7e0e69110f","observation_id":"1b4baf3b-32aa-4fc1-9b59-7f2ed226b745","resolution":{"observed_at":"2026-08-02T05:48:56.792230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14002","last_updated":"2025-03-24T02:20:01Z","snapshot_observed_at":"2026-08-20T11:07:37.630949Z","submitted_at":"2025-01-23T12:14:57Z","title":"Advancing Mathematical Reasoning in Language Models: The Impact of Problem-Solving Data, Data Synthesis Methods, and Training Stages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14002","snapshot_observed_at":"2026-08-02T05:48:56.951428Z","title":"Advancing mathematical reasoning in language models: The impact of problem-solving data, data synthesis methods, and training stages","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:56.951428Z"},"links":{"cited_paper":"/paper/2501.14002","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:f2541889fcbbb8e2eae513f4885b3d5c13349c3468e2d83e8e7d65cb8b0e1b0e","observation_id":"3c88d0d2-06e0-49ff-a296-1b950b37acc7","resolution":{"observed_at":"2026-08-02T05:48:56.951428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.058728Z","title":"Evaluating and improving tool-augmented computation-intensive math reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.058728Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8922a75070dff3102d21bb71d8b664585982a8b2bb39310a7b9de034d6b0de7b","observation_id":"37fe66f5-d49a-4d2f-aa9e-afa511215aa8","resolution":{"observed_at":"2026-08-02T05:48:57.058728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08190","last_updated":"2024-02-21T20:28:13Z","snapshot_observed_at":"2026-08-16T14:27:12.827551Z","submitted_at":"2024-01-16T08:08:01Z","title":"MARIO: MAth Reasoning with code Interpreter Output -- A Reproducible Pipeline","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08190","snapshot_observed_at":"2026-08-02T05:48:57.154852Z","title":"Mario: Math reasoning with code interpreter output–a reproducible pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.154852Z"},"links":{"cited_paper":"/paper/2401.08190","citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:27ee4b7c7cbb85d061410504b9729c4ac783b9427821841a244a239e4eb45fc8","observation_id":"be6990d5-da67-42aa-a201-a94e14b909ca","resolution":{"observed_at":"2026-08-02T05:48:57.154852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.314261Z","title":"Malt: Improving reasoning with multi-agent llm training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.314261Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8659353c75c60c1c800aba52cb545048257f2f0f007a0847ed07bc2d96afa931","observation_id":"866f18a4-6413-4b82-9d1e-6782299b57bd","resolution":{"observed_at":"2026-08-02T05:48:57.314261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.466725Z","title":"{\\dag} dagger: Distractor-aware graph generation for executable reasoning in math problems","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.466725Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:8e66ed2ec4f02a110effc2ff6acab3e1215bb78a615ce614c020f6e5b6ae14e4","observation_id":"0da25313-98b7-4fd1-9cd9-10ac9341f7a0","resolution":{"observed_at":"2026-08-02T05:48:57.466725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.580171Z","title":"Structured reasoning with tree-of-thoughts for bengali math word problems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.580171Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:25bb012711336fd23ffe1caaa88dc9cab757beb6bef79930d3d547b4d963b019","observation_id":"14ff5c91-a02b-4f94-82c7-30371db05577","resolution":{"observed_at":"2026-08-02T05:48:57.580171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.709445Z","title":"Groqcloud api documentation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.709445Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:e5e1865e921bdf54b9d7a7b6e75abe78e0c70cc1de56220a91897647da6ce9c7","observation_id":"8ddffcde-488c-4ede-9011-ed8ecae53410","resolution":{"observed_at":"2026-08-02T05:48:57.709445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.813164Z","title":"Qwen3-32b technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.813164Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:a4e2228a3d29f5daaee58a0fe3bb32baf26e036a5a53462b89363c6238c6b1fa","observation_id":"cb858195-0fc2-457c-a813-ee356ab80ed2","resolution":{"observed_at":"2026-08-02T05:48:57.813164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.890633Z","title":"Llama 3.1 model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.890633Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:342401fb31fc111f75d7f21d20f458f3ec11d8ccb081cfc9f521fdd2daa8ccdd","observation_id":"f7a35da5-55d1-4830-a73b-975de06302ca","resolution":{"observed_at":"2026-08-02T05:48:57.890633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:57.991945Z","title":"Llama 3.3 model card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:57.991945Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:e05d0f05b85e5eccd108843f5e7c35a57aa8088660c77e8443fc1b49eacc9d2f","observation_id":"cb55f4e3-0bf3-42e1-af53-9f1b8a10819b","resolution":{"observed_at":"2026-08-02T05:48:57.991945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:58.188112Z","title":"Llama 4 scout model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:58.188112Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:083de5814730c814270aed49d9a9b48594712deb64ad948d9edace0584ed4ead","observation_id":"53336ff1-0632-4844-a00d-64909720bd8e","resolution":{"observed_at":"2026-08-02T05:48:58.188112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:58.345895Z","title":"Gpt-oss: Open weight language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:58.345895Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bae154e43a267e9a9a1fad929f574e9c6e753de10ad71c40114c0a7590fdbd66","observation_id":"50abc97c-1f00-4f60-9002-ee88ef87e893","resolution":{"observed_at":"2026-08-02T05:48:58.345895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:58.453639Z","title":"Is gpt-oss good? a comprehensive evaluation of openai’s latest open source models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:58.453639Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:bd96547d8a8d40778f33e99968ac6ff77870135dbd790b11f905522ec0e77147","observation_id":"741d1a19-425b-4c7a-afd1-76fec1261d6f","resolution":{"observed_at":"2026-08-02T05:48:58.453639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:58.571640Z","title":"Gpt-oss 120b technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:58.571640Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:480eb3bb5d83632c182f24c75e3312221f70379d9cd825cba201aea1a7f91bba","observation_id":"7568bea2-b988-48c7-8a19-901d1765342b","resolution":{"observed_at":"2026-08-02T05:48:58.571640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:48:58.091669Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T05:48:58.091669Z"},"links":{"citing_paper":"/paper/2607.13248"},"observation_digest":"sha256:630d6ab7f975bf5a38a92469a49000b8fd8761a3ee63381c4a03467df205b48c","observation_id":"a08f0297-3fe5-4313-80ae-5a42044ba600","resolution":{"observed_at":"2026-08-02T05:48:58.091669Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13248","last_updated":"2026-07-14T20:23:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T00:13:35.494542Z","submitted_at":"2026-07-14T20:23:27Z","title":"GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":88,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 1 inbound Pith citation observation for arXiv:2607.13248."}