{"as_of":"2026-08-22T10:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b61dfd5c2f76c8f8fcb24d364f82105b574fdd49a1f6185ca44736872c91e458","coverage":[{"denominator":121,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:00:59.555618Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11141/citation-record","integrity":"/paper/2505.11141/integrity","json":"/paper/2505.11141/citation-record.json","paper":"/paper/2505.11141"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.143833Z","title":"Reasoning, problem solving, and intelligence.Handbook of human intelligence, pages 225–307, 1982","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.143833Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:9dce22bb7a99d4e4a9090dcaa13aa277767f509a384e495f30a3d1587410bee8","observation_id":"9b01b0bd-e42f-4612-bb51-3ab8bf8db8a2","resolution":{"observed_at":"2026-08-15T21:00:59.143833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.148090Z","title":"Intelligence and reasoning.The Cambridge handbook of intelligence, pages 419–441, 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.148090Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:c2f848c0d1a09083575b77529b5ec233adad6e89cd2adc5ebff5dd119436ca2a","observation_id":"6fbd7297-af31-4bd5-ae5b-677c292a6edf","resolution":{"observed_at":"2026-08-15T21:00:59.148090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.151841Z","title":"Levels of agi: Operationalizing progress on the path to agi.arXiv preprint arXiv:2311.02462, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.151841Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:5c835fad9384043ac4bb7787986407351a8133cc7f78d99c637f711ace72eea6","observation_id":"d465d40c-c445-45cb-83de-38e55385ded4","resolution":{"observed_at":"2026-08-15T21:00:59.151841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-15T21:00:59.155573Z","title":"Lmm-r1: Empowering 3b lmms with strong reasoning abilities through two-stage rule-based rl.arXiv preprint arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.155573Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:156c04707faa5589a16024c45a82cb0d6a45fa647f3c6455459581890c3cfb61","observation_id":"942b823d-7c6d-445a-ad55-f40fbab378a9","resolution":{"observed_at":"2026-08-15T21:00:59.155573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T21:00:59.159550Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.159550Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:820b253eeb44d667168122042599336fab8505eda508b7f98fba81a32aae0233","observation_id":"38a7a480-6e43-4b31-a541-0d7fa169fc2f","resolution":{"observed_at":"2026-08-15T21:00:59.159550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02893","last_updated":"2024-04-03T17:51:18Z","snapshot_observed_at":"2026-08-22T00:17:46.825097Z","submitted_at":"2024-04-03T17:51:18Z","title":"ChatGLM-Math: Improving Math Problem-Solving in Large Language Models with a Self-Critique Pipeline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02893","snapshot_observed_at":"2026-08-15T21:00:59.163223Z","title":"Chatglm-math: Improving math problem-solving in large language models with a self-critique pipeline.arXiv preprint arXiv:2404.02893, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.163223Z"},"links":{"cited_paper":"/paper/2404.02893","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:447974bae3c0514491319f6a2ee6ed5c2ca622a8a0394f8177e9a2511ea3c326","observation_id":"2ccad829-7663-4913-8d64-402cf4fadae7","resolution":{"observed_at":"2026-08-15T21:00:59.163223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-15T21:00:59.167402Z","title":"Mm-eureka: Exploring visual aha moment with rule-based large-scale reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.167402Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:c050545996365215b6dc436af2d0c42363dc1dff1013cce35be530ffe37c6302","observation_id":"b072b084-d996-444d-87d9-724d6cd8fb77","resolution":{"observed_at":"2026-08-15T21:00:59.167402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00757","last_updated":"2024-10-08T14:34:37Z","snapshot_observed_at":"2026-08-18T21:01:38.913905Z","submitted_at":"2024-01-01T13:53:53Z","title":"LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00757","snapshot_observed_at":"2026-08-15T21:00:59.171247Z","title":"Logicasker: Evaluating and improving the logical reasoning ability of large language models.arXiv preprint arXiv:2401.00757, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.171247Z"},"links":{"cited_paper":"/paper/2401.00757","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:3ce967c19e38e26458789980089bedbef6edbca44e9690c29d17128ed0004f40","observation_id":"8f164bf5-6f56-4ca9-8c72-3483d5e86bb7","resolution":{"observed_at":"2026-08-15T21:00:59.171247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09278","last_updated":"2024-02-18T06:24:12Z","snapshot_observed_at":"2026-08-18T10:32:38.108572Z","submitted_at":"2023-11-15T18:59:56Z","title":"Symbol-LLM: Towards Foundational Symbol-centric Interface For Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09278","snapshot_observed_at":"2026-08-15T21:00:59.175386Z","title":"Symbol-llm: Towards foundational symbol-centric interface for large language models.arXiv preprint arXiv:2311.09278, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.175386Z"},"links":{"cited_paper":"/paper/2311.09278","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4963217ccc1792b44de7affb986283958f3e99572930d9f98f1503d27b62fddb","observation_id":"111fb5e2-45aa-442c-9c4c-26b696a16f56","resolution":{"observed_at":"2026-08-15T21:00:59.175386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06158","last_updated":"2023-11-10T16:23:50Z","snapshot_observed_at":"2026-08-16T17:40:55.592497Z","submitted_at":"2023-11-10T16:23:50Z","title":"Language Models can be Logical Solvers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06158","snapshot_observed_at":"2026-08-15T21:00:59.179401Z","title":"Language models can be logical solvers.arXiv preprint arXiv:2311.06158, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.179401Z"},"links":{"cited_paper":"/paper/2311.06158","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:9d684ccb99ad580481761b86a63b6fcb03fd9c32895a831d2991ebb451e9f1b6","observation_id":"d79de149-d067-4563-bb0b-5c2652268e76","resolution":{"observed_at":"2026-08-15T21:00:59.179401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12147","last_updated":"2023-10-28T04:22:58Z","snapshot_observed_at":"2026-08-16T17:40:13.505587Z","submitted_at":"2023-05-20T09:23:09Z","title":"LogiCoT: Logical Chain-of-Thought Instruction-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.12147","snapshot_observed_at":"2026-08-15T21:00:59.183818Z","title":"Logicot: Logical chain-of-thought instruction-tuning.arXiv preprint arXiv:2305.12147, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.183818Z"},"links":{"cited_paper":"/paper/2305.12147","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:d31123c1661dee9748a622ee13f2e25eabb7c8c8072cbe377f756196b79f0f70","observation_id":"deeab4a9-3e0a-417e-9d34-c8aa23cceab1","resolution":{"observed_at":"2026-08-15T21:00:59.183818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-08-14T07:26:32.101930Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-15T21:00:59.187803Z","title":"Opencodereasoning: Advancing data distillation for competitive coding.arXiv preprint arXiv:2504.01943, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.187803Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:71c1c17135675230c11c92a4377a7529dbd4e7f7dd2b070bafe018445acf3f61","observation_id":"d27b262c-4f30-40c8-b17c-685928490a0a","resolution":{"observed_at":"2026-08-15T21:00:59.187803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.192248Z","title":"Self-planning code generation with large language models.ACM Transactions on Software Engineering and Methodology, 33(7):1–30, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.192248Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:9b57eff3d8b8a6a98f1211395277ffa6cf20ed8d6c6df4a3d382e70457beb30b","observation_id":"5cbd7a7d-d1a6-45fa-b735-850e25339e1e","resolution":{"observed_at":"2026-08-15T21:00:59.192248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.196631Z","title":"Structured chain-of-thought prompting for code generation.ACM Transactions on Software Engineering and Methodology, 34(2):1–23, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.196631Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4cafaf3a5d46bad6d9c2502352d8a40da4c55096e0c51c843e8f65b2f7555909","observation_id":"590fdc54-8eee-402c-bac4-0ab10656dbf9","resolution":{"observed_at":"2026-08-15T21:00:59.196631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08784","last_updated":"2024-02-23T04:56:37Z","snapshot_observed_at":"2026-08-16T17:40:11.359239Z","submitted_at":"2023-08-17T04:58:51Z","title":"CodeCoT: Tackling Code Syntax Errors in CoT Reasoning for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08784","snapshot_observed_at":"2026-08-15T21:00:59.200419Z","title":"Codecot: Tackling code syntax errors in cot reasoning for code generation.arXiv preprint arXiv:2308.08784, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.200419Z"},"links":{"cited_paper":"/paper/2308.08784","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:a581a097cd6975dfbb716051e9bbade6722d7ab975009e2669129935153424e3","observation_id":"74d08069-4dd6-4a02-81bd-180aaa5140b3","resolution":{"observed_at":"2026-08-15T21:00:59.200419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T21:00:59.204340Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.204340Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f2197a9337fe9917dc6564e5a5e66219d5045d69213045e574bee585ee7ee5e8","observation_id":"f2f304f6-4926-4a90-bb0f-3a28489982e6","resolution":{"observed_at":"2026-08-15T21:00:59.204340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T21:00:59.208247Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.208247Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:d09f398d5705a33d6de808dda876283abeee9d3df30475f3ba57ef4c1a6957e2","observation_id":"7aa369a8-f284-403c-be99-edb45601d507","resolution":{"observed_at":"2026-08-15T21:00:59.208247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.212160Z","title":"Springer, 2007","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.212160Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:881c0530b68e05cf67d3bfacb6c0188b29e193674e8b47e8efccb21b1420e32f","observation_id":"2b1c60bd-76c2-446f-9331-519a992666e7","resolution":{"observed_at":"2026-08-15T21:00:59.212160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06805","last_updated":"2024-01-18T07:31:47Z","snapshot_observed_at":"2026-08-20T06:07:33.906469Z","submitted_at":"2024-01-10T15:29:21Z","title":"Exploring the Reasoning Abilities of Multimodal Large Language Models (MLLMs): A Comprehensive Survey on Emerging Trends in Multimodal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06805","snapshot_observed_at":"2026-08-15T21:00:59.216711Z","title":"Exploring the reasoning abilities of multimodal large language models (mllms): A comprehensive survey on emerging trends in multimodal reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.216711Z"},"links":{"cited_paper":"/paper/2401.06805","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:431219e6a3b98eebb66bc8fa1c605e3580aa5bc776f47ee64e5c19ba2baf9fa6","observation_id":"aa0867be-5301-4ea6-9526-6a22d5d3ff55","resolution":{"observed_at":"2026-08-15T21:00:59.216711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-15T21:00:59.220726Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization.arXiv preprint arXiv:2503.10615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.220726Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:6dc88343985271019ecf9c8daafb21f3ce164afc4be75824219a24993683d4c7","observation_id":"4b5d843b-68ae-4bba-8048-27346506a819","resolution":{"observed_at":"2026-08-15T21:00:59.220726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.224784Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.224784Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:cd99d3bcdc4084b10fe3b6e36df7ca2c39b584ff11fd8e542116accf69d1d5b9","observation_id":"126ca753-9ff0-4f06-8aab-cf7da700f9e2","resolution":{"observed_at":"2026-08-15T21:00:59.224784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-19T07:59:58.721057Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-15T21:00:59.228526Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.228526Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4d5da47377e273bed112503151a11d7dffa53215b92354ee858930ea9ff281fe","observation_id":"0c668467-9f5f-4a06-8aad-64b234a0a74d","resolution":{"observed_at":"2026-08-15T21:00:59.228526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10291","last_updated":"2025-03-13T12:03:37Z","snapshot_observed_at":"2026-08-20T07:39:09.492234Z","submitted_at":"2025-03-13T12:03:37Z","title":"VisualPRM: An Effective Process Reward Model for Multimodal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10291","snapshot_observed_at":"2026-08-15T21:00:59.232625Z","title":"Visualprm: An effective process reward model for multimodal reasoning.arXiv preprint arXiv:2503.10291, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.232625Z"},"links":{"cited_paper":"/paper/2503.10291","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1aa824b7accbe13f522cbe937c5658bca612f2e626dbd3306929d2fce332fbd6","observation_id":"946cd72b-23ce-41bc-8664-4c5aff50a98f","resolution":{"observed_at":"2026-08-15T21:00:59.232625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16081","last_updated":"2025-03-28T11:19:21Z","snapshot_observed_at":"2026-08-20T03:28:06.574341Z","submitted_at":"2025-03-20T12:22:18Z","title":"OThink-MR1: Stimulating multimodal generalized reasoning capabilities via dynamic reinforcement learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16081","snapshot_observed_at":"2026-08-15T21:00:59.236677Z","title":"Othink-mr1: Stimulating multimodal generalized reasoning capabilities through dynamic reinforcement learning.arXiv preprint arXiv:2503.16081, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.236677Z"},"links":{"cited_paper":"/paper/2503.16081","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:e90c38bcee72a009d32e9c42ac633af9f6a003441b7e28ff1373cc7e61573d71","observation_id":"45b70ba3-813b-405d-ab7d-7248588f551b","resolution":{"observed_at":"2026-08-15T21:00:59.236677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.240685Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.240685Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:fe259156c7d459af0d1331aa979150acd16b1fed1129151c9d2b09e9347bea28","observation_id":"87dcb263-bd00-413b-823f-3fb3bab311c9","resolution":{"observed_at":"2026-08-15T21:00:59.240685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.244061Z","title":"Open-r1-video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.244061Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:301f277ef0829ecfc9269592a8adb745acf7daa06ae532b75e5b5cedf4d4e910","observation_id":"6fcabbe8-6ade-4025-b8db-731faac2ffe0","resolution":{"observed_at":"2026-08-15T21:00:59.244061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-20T14:55:32.873899Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-08-15T21:00:59.247883Z","title":"Visualpuzzles: Decoupling multimodal reasoning evaluation from domain knowledge.arXiv preprint arXiv:2504.10342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.247883Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:d319a6df66473eb50f78ce7ad7cad3595f88913ddef18cd33931c6cab7dd8c64","observation_id":"3e1fca7e-9e72-4ef5-bbf0-8dbbbf594ba0","resolution":{"observed_at":"2026-08-15T21:00:59.247883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00698","last_updated":"2025-06-04T16:20:49Z","snapshot_observed_at":"2026-08-16T03:48:36.336234Z","submitted_at":"2025-02-02T07:12:03Z","title":"MM-IQ: Benchmarking Human-Like Abstraction and Reasoning in Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00698","snapshot_observed_at":"2026-08-15T21:00:59.251643Z","title":"Mm-iq: Benchmarking human-like abstraction and reasoning in multimodal models.arXiv preprint arXiv:2502.00698, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.251643Z"},"links":{"cited_paper":"/paper/2502.00698","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:044a861e897758017c68980c84c0b282dd7e559d57538e19c144a9c1d06ac266","observation_id":"23aa7b98-9633-401e-b355-e834fa88e42e","resolution":{"observed_at":"2026-08-15T21:00:59.251643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-15T21:00:59.255612Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models.arXiv preprint arXiv:2504.15279, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.255612Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f2dc4ab1cf1df7af2a2b64285657ccc1b5f81547feab01f4ff554abde78027c4","observation_id":"b82014cd-bf82-458d-87fb-1ca793ecf2d1","resolution":{"observed_at":"2026-08-15T21:00:59.255612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.259756Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.259756Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:888fc92afe3ee166ea03199821ad05917b3d0a6b901b80b47250b6cb847cbede","observation_id":"96dc97c7-5308-4420-86ed-34a2111bd7c1","resolution":{"observed_at":"2026-08-15T21:00:59.259756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.263536Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.263536Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:b7c4140565f895e01f8d37d8d0bf18fb2f0defee4bef3a08fb8257cb2d47466c","observation_id":"266301ef-630b-4fc3-bd6a-df4c2a398974","resolution":{"observed_at":"2026-08-15T21:00:59.263536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.267404Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.267404Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:6980dfbe35fb0e4bd4c6501c6903f0e6aead319212a42db4f2af4fd1210bf76d","observation_id":"e3c30b03-3d84-4f58-87d4-78358e7ebfa7","resolution":{"observed_at":"2026-08-15T21:00:59.267404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T21:00:59.271391Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.271391Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:19152531f1a0c4af4875d6184451ba70c8a20cce167375ad61f74c1d4cec5368","observation_id":"0da66503-5c32-4921-a30e-1d2a527a2a1e","resolution":{"observed_at":"2026-08-15T21:00:59.271391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.275344Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.275344Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f369e32f247abff6e875cefa67a811a5146c79c5e29175e63b706cfdd7a2f64a","observation_id":"5aa9be15-7c32-4625-8aee-827af55d7df4","resolution":{"observed_at":"2026-08-15T21:00:59.275344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.279006Z","title":"Minigpt-4: Enhancing vision- language understanding with advanced large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.279006Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:fc646487134a47bd90116f4ad3bb97b97277189d24ee094d39d034588f40edfb","observation_id":"06c8bf22-2dbc-4557-9cc3-559ab2af888d","resolution":{"observed_at":"2026-08-15T21:00:59.279006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.282932Z","title":"Gpt-4o: A multimodal language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.282932Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:5c226ec033d9454edb97beaa02cbdb50b89030b55a39a507b76d413752b115f4","observation_id":"31cf828d-8819-4179-9fe6-098ae51117d0","resolution":{"observed_at":"2026-08-15T21:00:59.282932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T21:00:59.286731Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.286731Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:98cacbb06d7d31e10fb306cc2c0ffcd6b47ad98291afd5679b8b293ac11d2190","observation_id":"af6bb968-af5e-45ad-8ac9-70924b9cce31","resolution":{"observed_at":"2026-08-15T21:00:59.286731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.290609Z","title":"Claude: A conversational ai assistant, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.290609Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:77798abb258ee311bb3c307553b25ad854ac1c8c72ed95b6ee2ffa7f93ce71fe","observation_id":"b7141138-c70c-4db1-8660-cbebf4c6f3a9","resolution":{"observed_at":"2026-08-15T21:00:59.290609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-15T21:00:59.294831Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.294831Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:bf91d3f55d6dd3bdacff3b2f71df8b970a967b76ac93ab3616749ba0474484ea","observation_id":"2d0f7752-44c5-4f92-b603-c9c2f81f0e40","resolution":{"observed_at":"2026-08-15T21:00:59.294831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T21:00:59.299292Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.299292Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:69514a5c2bbab77da779902675421638d3076d6e777d9eb27a24b6123079a9fc","observation_id":"2694a045-83cc-4cd6-939d-ac4a826f4422","resolution":{"observed_at":"2026-08-15T21:00:59.299292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T21:00:59.303953Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.303953Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f9d3313234c4888a366d147e798da95ff65a51c9d173bd0fbc56d443d78ed8f7","observation_id":"f8274c36-01d8-4b3e-a817-b0f3cbc43459","resolution":{"observed_at":"2026-08-15T21:00:59.303953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-15T21:00:59.307992Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.307992Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:0c4ff62c15904b440e03d380cadcbc2cd17ceece0ef25949e779d918fb9b3b6c","observation_id":"93733ea4-3ca0-455a-85c4-6f1abd24f5b3","resolution":{"observed_at":"2026-08-15T21:00:59.307992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.312073Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.312073Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:53702ae034c21f11799a4eca5b9797dd5f03d38751bdcf3e05573bc26574d682","observation_id":"2c1a9576-a1dc-4ac7-80c5-7252db5066c8","resolution":{"observed_at":"2026-08-15T21:00:59.312073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-15T21:00:59.316681Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.316681Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:99018c4b5ef600733aa5cf91081c75c7ca2c6d2ffb2a3a6f217de1893b609a1f","observation_id":"2d672641-e81d-4906-ac7d-46a8c4d7f37e","resolution":{"observed_at":"2026-08-15T21:00:59.316681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-08-13T18:24:04.904767Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-15T21:00:59.321375Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.321375Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:fceac6dd41ef81ebf7b1e1f6a495512f92b99f18a067197487adc5ab0e7eab3a","observation_id":"fe0b1d75-14b5-4aae-af7a-f5ae797f4393","resolution":{"observed_at":"2026-08-15T21:00:59.321375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-15T21:00:59.326590Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.326590Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:3415360113cb31136248cfdaa7cbdac66842a44faf358e50cc44375449211d93","observation_id":"da2870a5-ca2b-4d6d-9c79-30c6cb2ad0d3","resolution":{"observed_at":"2026-08-15T21:00:59.326590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-15T21:00:59.331240Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.331240Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1223231c024beccff3807f698915ab74ea91542bf450d64ded0e8296d32cdd84","observation_id":"2c4efc12-8a41-4da1-abbc-af479be850e7","resolution":{"observed_at":"2026-08-15T21:00:59.331240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.335135Z","title":"Pangea: A fully open multilingual multimodal LLM for 39 languages","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.335135Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:7802ce6273cc71be11db4d29b18952079f64574e434065d2941185dfba7049c6","observation_id":"0f548ba1-bc33-40ad-b000-52b6df849d2a","resolution":{"observed_at":"2026-08-15T21:00:59.335135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13824","last_updated":"2024-11-06T08:29:22Z","snapshot_observed_at":"2026-08-17T23:12:16.766867Z","submitted_at":"2024-10-17T17:48:54Z","title":"Harnessing Webpage UIs for Text-Rich Visual Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13824","snapshot_observed_at":"2026-08-15T21:00:59.339748Z","title":"Harnessing webpage uis for text-rich visual understanding.ArXiv, abs/2410.13824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.339748Z"},"links":{"cited_paper":"/paper/2410.13824","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:806d2777bbb9be68c46b87114ebfb83bf1c125d59374cef4cc156de7158cc507","observation_id":"51f20111-f6b5-49f0-9ace-c65bd5bc8055","resolution":{"observed_at":"2026-08-15T21:00:59.339748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-15T21:00:59.348610Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms.ArXiv preprint, abs/2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.348610Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4f85189e5927cb36811ad9cd2278d6658b434e60492127f6c04628891ec8730e","observation_id":"ffe5cd88-b90e-43c6-9847-ac75d913a313","resolution":{"observed_at":"2026-08-15T21:00:59.348610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:00:59.353067Z","title":"The llama 3 herd of models.ArXiv preprint, abs/2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.353067Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:3749396a430a807a69918253d79b2bd08d3dde1096c9262af344e22d16425ed8","observation_id":"c3000e9c-444e-44fe-a609-934d48f0fe48","resolution":{"observed_at":"2026-08-15T21:00:59.353067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.356822Z","title":"Math-llava: Bootstrapping mathematical reasoning for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.356822Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:8a438f586ceaaa1d857daafa0e28b74121db569597ca02aa6993679915fc093e","observation_id":"f486d850-d21c-4f7f-b595-9f2197a97a44","resolution":{"observed_at":"2026-08-15T21:00:59.356822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00147","last_updated":"2024-08-30T07:37:38Z","snapshot_observed_at":"2026-08-16T13:22:43.390351Z","submitted_at":"2024-08-30T07:37:38Z","title":"MultiMath: Bridging Visual and Mathematical Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00147","snapshot_observed_at":"2026-08-15T21:00:59.361895Z","title":"Multimath: Bridging visual and mathematical reasoning for large language models.arXiv preprint arXiv:2409.00147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.361895Z"},"links":{"cited_paper":"/paper/2409.00147","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:280c5f133e84efd68ec032e81b6d01b7b66c3478dd02bae1a6863eb5a2052a0c","observation_id":"be250d21-e842-49a3-8f98-6d9065a73682","resolution":{"observed_at":"2026-08-15T21:00:59.361895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.365921Z","title":"Med-flamingo: a multimodal medical few-shot learner","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.365921Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:e088ee592b722b7bf77c641c292cda65ac21f3c18c036bec38880d22dc66bbce","observation_id":"183a1482-dbf6-4aba-99b6-5aeba392488f","resolution":{"observed_at":"2026-08-15T21:00:59.365921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.369418Z","title":"Med-moe: Mixture of domain-specific experts for lightweight medical vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.369418Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:a6ceee0d0204176d4cc9c901cf49036112ea2b898a23e3bc33908b25660b839c","observation_id":"0fade284-7987-467d-91d4-02c561ee2ba6","resolution":{"observed_at":"2026-08-15T21:00:59.369418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.373609Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.373609Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:fbe63aae277a044da0058e06171260de6f9fb786a9a544cdbd61b30d8d53ac43","observation_id":"027bb3a7-7c97-4254-b7bf-2601e24db763","resolution":{"observed_at":"2026-08-15T21:00:59.373609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-08-16T17:38:22.018669Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-15T21:00:59.377307Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.377307Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1a277bf83cfe19a162d510ec843aa39347d5c41fc672ca66d86608d6d4f4fb31","observation_id":"52b3d24c-7bcc-479b-a14d-a47501771163","resolution":{"observed_at":"2026-08-15T21:00:59.377307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.381458Z","title":"Star: Self-taught reasoner bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.381458Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1c333d7e679a32cd6798148f0db1aecfc1c0dfcfc60513a875c557ccb8d19c9e","observation_id":"9462d6c9-bf94-4a4f-b89c-11a99540f6a6","resolution":{"observed_at":"2026-08-15T21:00:59.381458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09629","last_updated":"2024-03-18T07:56:48Z","snapshot_observed_at":"2026-08-18T15:25:16.958531Z","submitted_at":"2024-03-14T17:58:16Z","title":"Quiet-STaR: Language Models Can Teach Themselves to Think Before Speaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09629","snapshot_observed_at":"2026-08-15T21:00:59.385419Z","title":"Quiet- STaR: Language models can teach themselves to think before speaking.arXiv preprint arXiv:2403.09629, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.385419Z"},"links":{"cited_paper":"/paper/2403.09629","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:854ada8e4c5d06141f3dc3d85c5fdc6abec459584a9a0d291cc3d822d9f6a1d7","observation_id":"a3b024cb-163f-4f28-b6c9-6fb4b0c3c7c4","resolution":{"observed_at":"2026-08-15T21:00:59.385419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.390247Z","title":"Qvq: To see the world with wisdom, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.390247Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f6ee37f65bd608b43b780ceab16a895460734e78c3fd632f2973fadd8a2f7c10","observation_id":"3c5b7f1a-73be-4a5b-aaa6-ab32ee6562e6","resolution":{"observed_at":"2026-08-15T21:00:59.390247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.394676Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.394676Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:2a4329dbedc6b9e01915865709e5bdd6aa365172f6a343d6f4661d82ada39f0c","observation_id":"b7214e0e-bc38-4712-b2b5-b9eb1e42e5e6","resolution":{"observed_at":"2026-08-15T21:00:59.394676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-15T21:00:59.398663Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.398663Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:2c319fcb08f750e185e6fd92a77b36ece9cd36a2ada50af68fc845f221c33b42","observation_id":"b353542f-2d19-417b-902e-718beac5dd0a","resolution":{"observed_at":"2026-08-15T21:00:59.398663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.402696Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.402696Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:d29eccbf14cbee6b1006c30b4c231e176d9de640d323af6220c77443e0a033f8","observation_id":"f22818f8-29b5-4380-ae4d-e55d70ec3e73","resolution":{"observed_at":"2026-08-15T21:00:59.402696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-15T21:00:59.406856Z","title":"Agentbench: Evaluating llms as agents.arXiv preprint arXiv:2308.03688, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.406856Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:3ba274029844d7962df51fe82f840335cf341c63b189374fe4bafb76b953cce9","observation_id":"2fb5dd0d-43da-4279-8def-12dcf65cfdeb","resolution":{"observed_at":"2026-08-15T21:00:59.406856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-16T17:40:14.613190Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-15T21:00:59.411738Z","title":"Tooleyes: fine-grained evaluation for tool learning capabilities of large language models in real-world scenarios.arXiv preprint arXiv:2401.00741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.411738Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1fbd5e3c34a504f1bf174e5994b94d4f51cf00575772a90d1b7a0bd3083e96e2","observation_id":"9a358f92-c552-45e3-b3fc-e11d25d47c04","resolution":{"observed_at":"2026-08-15T21:00:59.411738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.415729Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advances in Neural Information Processing Systems, 36:46212–46244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.415729Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:5c0defc751a7290d6c1dbac8ab5f841ac4f09294b86cbaaf887ce7ab09e29776","observation_id":"f58b9c21-638b-419b-ac58-047211f86d55","resolution":{"observed_at":"2026-08-15T21:00:59.415729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.419749Z","title":"Egothink: Evaluating first-person perspective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.419749Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4021eaf1609962181f1f5cdcacd24e0a94a0dfccc0b22e99ad26efa4136922a4","observation_id":"d96fa136-b120-4857-bad7-20002bed72bc","resolution":{"observed_at":"2026-08-15T21:00:59.419749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.423494Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.423494Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:3c4f58753a452609fd82882db4c79b800015148d89174aacb47844f8e26cf68e","observation_id":"7e346f55-3341-4de5-ac5d-a1398baa9cb5","resolution":{"observed_at":"2026-08-15T21:00:59.423494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.427615Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge.2019 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 3190–3199, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.427615Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:2c467e72d4958086f426648d596f63f42ce4e37aedee20c01d56242f4d6477c0","observation_id":"80f72f2f-d8d7-412b-9d1c-02ee2aff2602","resolution":{"observed_at":"2026-08-15T21:00:59.427615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.431764Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.431764Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:cf42f2adee6aec1fff452dd6ba680ca5febd82f79e2ee1f98b89f8cda4314570","observation_id":"5c1320a2-db16-4cbb-8926-6e2a3acea4cd","resolution":{"observed_at":"2026-08-15T21:00:59.431764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.435780Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.435780Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:578c1316e73767b82996d356f11a7cbfe80ef8bec38f5cb0b6f8071d199ce8d2","observation_id":"0b293c01-c3a9-43d5-bdff-79e2cb2ae5a1","resolution":{"observed_at":"2026-08-15T21:00:59.435780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-15T21:00:59.440333Z","title":"Humanity’s last exam.ArXiv, abs/2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.440333Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:6d7141497cb41986a6dfcdb9885f610652183d4237e7b4f6c2cc11b96352b5e9","observation_id":"f461b015-adbb-412c-b320-b48ef8260221","resolution":{"observed_at":"2026-08-15T21:00:59.440333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.445137Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InEuropean Conference on Computer Vision, pages 169–186","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.445137Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:e2422607bcb234d5afab19531d12a4dfa8d7f5f4283daabd32c97993750247b4","observation_id":"3a1a2842-322c-4fec-b604-b4b16cc20081","resolution":{"observed_at":"2026-08-15T21:00:59.445137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T21:00:59.448758Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.448758Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:b66e5c5e689272d5f99c4f3d0fb92e6216036275e8c2f26abccac83db08ad881","observation_id":"f2b90fb1-d75a-44d1-b90a-cd0412ccae4e","resolution":{"observed_at":"2026-08-15T21:00:59.448758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10378","last_updated":"2024-03-15T15:08:39Z","snapshot_observed_at":"2026-08-16T14:09:25.342714Z","submitted_at":"2024-03-15T15:08:39Z","title":"EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10378","snapshot_observed_at":"2026-08-15T21:00:59.455724Z","title":"Exams-v: A multi-discipline multilingual multimodal exam benchmark for evaluating vision language models.arXiv preprint arXiv:2403.10378, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.455724Z"},"links":{"cited_paper":"/paper/2403.10378","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:76823e77d7eeb5a86b6368c651088970f49d2c30ee76dbd24544ae00d92088fb","observation_id":"86c09a99-d31d-471a-b009-cbacb4f554da","resolution":{"observed_at":"2026-08-15T21:00:59.455724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.460568Z","title":"Scienceqa: A novel resource for question answering on scholarly articles.International Journal on Digital Libraries, 23 (3):289–301, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.460568Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:7345642d210410b8d5db69e7de1a9880fe4994d69ab92e383fcbd39914e1af70","observation_id":"644e8399-f47e-4bb0-bd86-dc018eccb77a","resolution":{"observed_at":"2026-08-15T21:00:59.460568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-15T21:00:59.465245Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.465245Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:d8d33ba2321f491e420430b72205c0013070499a3b4475e7bdea91b891a9cdc2","observation_id":"1cb4f7d5-cc86-485c-9451-bee23e149ba5","resolution":{"observed_at":"2026-08-15T21:00:59.465245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-08-16T17:40:56.177453Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-15T21:00:59.469347Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision- language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.469347Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:b4c6e36402a06691f84d364824a4201b9bcbf8ac7e921ea3ac6ac412015dd97b","observation_id":"e611daba-748b-438a-bfc9-a85845645edc","resolution":{"observed_at":"2026-08-15T21:00:59.469347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.473292Z","title":"Introducing openai o3 and o4-mini, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.473292Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:df66828d29f5bcb1327ccc7c5ba48f0efc84e04222e0956975d2735510bc35d8","observation_id":"310d25b8-954a-49e2-b126-04bf88a79a6b","resolution":{"observed_at":"2026-08-15T21:00:59.473292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.477768Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.477768Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:c97f8d60420715eb070693e3c410e85b306545f01ffcfdd89c928ca93d02f4f7","observation_id":"11e372b3-f8ff-40fb-a60c-0b6369ad6da2","resolution":{"observed_at":"2026-08-15T21:00:59.477768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.481666Z","title":"black + white = black","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.481666Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:05301a9bce417e7ed65f13a7a6b1d9008debb3776cdb0f7444372682692d8d7c","observation_id":"97a17e25-d4a2-46e6-b471-675d3e17dc6c","resolution":{"observed_at":"2026-08-15T21:00:59.481666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.486202Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.486202Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:48b84d49fa3f4e1cd779e072a164d3460ee6a6b51eca896c5cc3c6aba7aef4fd","observation_id":"94aed1f4-904d-4adb-bb14-b01d495ddbba","resolution":{"observed_at":"2026-08-15T21:00:59.486202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.489974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.489974Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:db5fe015ee99eeec4e2e3f0509d65257df5d58a294fd7084c46c864569e7060f","observation_id":"a459a31a-7b38-460e-b1ec-232ef6e82ec0","resolution":{"observed_at":"2026-08-15T21:00:59.489974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.493984Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.493984Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:5187288e841d253b4f18684cb88ec7b0d3332eba4827c1129ba7ac381f60e632","observation_id":"0b2db3b0-2f37-453c-af85-afe20722b713","resolution":{"observed_at":"2026-08-15T21:00:59.493984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:00:59.497957Z","title":"during working hours,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.497957Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:270c89c94b642ac37d66fcbfea1fd69388700e19e9d989923fc4845890c2c1a9","observation_id":"20fa0037-5474-491d-9ef6-93cbd1a252fd","resolution":{"observed_at":"2026-08-15T21:00:59.497957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.810828Z","title":"for profit,","venue":null,"work_id":"54697357-408e-4e1b-bbd3-a776714e5ac6","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.501620Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:2d999d4fae4ee251e46d574a7593d37d09f5506e56324b16e0c441a6915323f1","observation_id":"eab776ae-9e6f-4d7b-ae9d-85ffb12cc433","resolution":{"observed_at":"2026-08-15T21:01:00.815190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.798086Z","title":"must,\" \"main,","venue":null,"work_id":"4529742a-c29c-4308-b9b5-b0c63fc0135d","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.505286Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:8e671c84dec0f6d04a3654cf281c2a8505282014b00b2c28d1f8b59e2e805949","observation_id":"683eea3b-4027-4f69-9e98-e25e7e30638c","resolution":{"observed_at":"2026-08-15T21:01:00.802838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.784482Z","title":"deconstruct","venue":null,"work_id":"0ad6cdf5-4a07-40ec-87d3-b28ccbbd5568","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.509218Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:6da443e2e46425a3e63ebc8c77987b2e2ca225be89544985a27715a9eefc755d","observation_id":"eb89377d-292e-4eb6-950b-35520842aeba","resolution":{"observed_at":"2026-08-15T21:01:00.788369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.770770Z","title":"- Step 5: Strictly and systematically compare the option’s information with the defini- tion’s core elements","venue":null,"work_id":"5cc9c249-5929-4c59-8232-7dde6e6f9b1c","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.512934Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:4bff98005935669729267ad89261f443ee9ca93fd10f484c57550f3bd60f9dda","observation_id":"86a5383b-d01a-4a37-8db7-7935bd02cb1b","resolution":{"observed_at":"2026-08-15T21:01:00.775910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.757755Z","title":"belongs to","venue":null,"work_id":"cb4547c4-8169-4b92-8cb7-43bc17e0f7b0","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.516889Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:8c30a595f45f4050388eb441ac62ac142c6000f82b038c0aa65b69e79ef97411","observation_id":"f6a62f66-96b9-4614-a9ba-16adf5cfe426","resolution":{"observed_at":"2026-08-15T21:01:00.761912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.745049Z","title":"Choose the one that best matches or mismatches the definition","venue":null,"work_id":"8285af08-6178-4f2c-a6e6-d1ed79865781","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.520513Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:59058f6defa202e4bdf800ff6922f16ac45204f151da594042719934ccb4bbb3","observation_id":"e373f18c-daec-4418-9e31-9ba2bd6ef162","resolution":{"observed_at":"2026-08-15T21:01:00.749396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.727345Z","title":"Always take the definition as the sole criterion","venue":null,"work_id":"beeca842-0b97-492a-9fe9-9c7c2d03d399","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.524434Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:fb3e10138b490afcd446b4f90c99c3d0591f8044ca46c61527b301275f387628","observation_id":"bc9867c2-1799-4ee0-b4a2-88ba3af3ddbe","resolution":{"observed_at":"2026-08-15T21:01:00.731799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.714731Z","title":"must,\" \"main,","venue":null,"work_id":"0b7d353e-292c-4eb2-939f-6252dfd99e97","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.528151Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:bf978b5eba96e02c71e4c4e94b1bb2b892bb5aad4dfd20691fac68925458d78d","observation_id":"8b4285e3-d13e-48cb-be54-65feff1d63f6","resolution":{"observed_at":"2026-08-15T21:01:00.719458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.702485Z","title":"justifiable defense","venue":null,"work_id":"b57bf7e7-e492-46ea-a7e1-2a2ff7d1a0a8","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.532020Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:68921fd4934304cbfcdbff5f988a69a9f38613fee9571246a521cfd007ca2c27","observation_id":"76020b2c-8134-4877-9893-e22fcaff5be9","resolution":{"observed_at":"2026-08-15T21:01:00.706600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.689794Z","title":"Or\" vs","venue":null,"work_id":"cc66934a-0660-4a2e-8bcc-da0a9bdab627","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.535732Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:6020b88e171a7569120d1a1d5b71a388990dd23516fc06afa93ed464f5f51e3f","observation_id":"2243a021-4918-4245-9872-16c964de8b97","resolution":{"observed_at":"2026-08-15T21:01:00.693791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.671273Z","title":"belongs to","venue":null,"work_id":"c4e45912-745d-45cd-92f5-18608f73dc36","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.539713Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:ccfbc631c59be29fd314d20d57cb412c50555b8bc819f7c75d7d432a48d74136","observation_id":"a7c078ef-b16d-4833-8f29-b69fdf4fd7c2","resolution":{"observed_at":"2026-08-15T21:01:00.680001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.655177Z","title":"Word-Picking","venue":null,"work_id":"d20bab93-b8d4-4956-8dc7-703dd9b09865","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.543611Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:f0f239d0a1317d6257c23526249b1a225b2c5197c8a097a6ba12533ecd8f9c2d","observation_id":"18f4c6f3-10d2-442a-a5a1-6f967807db32","resolution":{"observed_at":"2026-08-15T21:01:00.661637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.642241Z","title":"one-sentence summary","venue":null,"work_id":"94c27294-7e6f-4f29-a0a7-1b68c6188d02","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.547332Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:cf3b41575033bd84e47b025d77235d2b08dcdbdab5f3511e2a9db959ac201173","observation_id":"906585cc-ec6b-4475-aeb8-b101b60e459e","resolution":{"observed_at":"2026-08-15T21:01:00.646462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.628510Z","title":"在工作时间”、“未经许可","venue":null,"work_id":"b7eac488-9303-4346-b0b3-e5d52685e290","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.551152Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:1ee168f70d29bc4cd623a34d84dfc73c280c9fb5dfc81c60d56d714b24238751","observation_id":"24447a73-3b72-4239-b906-795e206198f7","resolution":{"observed_at":"2026-08-15T21:01:00.632714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:00.612314Z","title":"必须”、“主要”、“故意","venue":null,"work_id":"2dbc8916-2da5-4cb9-98ff-da9a6ef719b8","year":null},"citing_paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T21:00:59.555618Z"},"links":{"citing_paper":"/paper/2505.11141"},"observation_digest":"sha256:654ec390fd41393c4cecd9f916f8e53ab921d7f3a085d8cf9125d9eb86a431e4","observation_id":"6ad78094-1698-4cab-a37c-7a55d69c3d76","resolution":{"observed_at":"2026-08-15T21:01:00.617875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11141","last_updated":"2025-05-24T02:18:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T14:43:43.820248Z","submitted_at":"2025-05-16T11:41:19Z","title":"Human-Aligned Bench: Fine-Grained Assessment of Reasoning Ability in MLLMs vs. Humans"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":85,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":121},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 100 of 121 outbound references and 0 inbound Pith citation observations for arXiv:2505.11141."}