{"as_of":"2026-08-04T16:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60665f206f5be19d0c3ad5bfaf0961b763e51ed76145d5002102b8a3a7d54571","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:25:37.168330Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":28,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:50:20.183933Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T09:37:00.824668Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:b28215ef18d82d0e20598e1cfeaf9053a42ff97a2ea3d2902107d597e82a3ae3","observation_id":"ecbae974-0770-40b4-b6da-45b8cb86e6d2","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:0949db1860017d3589b9afbeccfd315d6aca377b67028b21a7cee5823ca7b32f","observation_id":"3be3dc69-02b2-43c8-ba62-ad5c117f3a99","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.08644","last_updated":"2026-04-09T17:51:11Z","snapshot_observed_at":"2026-08-02T14:49:38.234793Z","submitted_at":"2026-04-09T17:51:11Z","title":"EXAONE 4.5 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:47:34.692414Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.08644"},"observation_digest":"sha256:d818a3e3784a5f16c9a1c5112ab934d945bf6c29f182c0ed50233b60941fc614","observation_id":"9846bd0a-5d1f-42ee-ae57-920cd691042d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T23:56:02.856878Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:e28f03c4adbb6dfdb6d1c20ffc922ed89ff1f40b3c9cde6abc17d51941078bb7","observation_id":"37bffe5c-46df-406f-b6b1-b7718587d055","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.20665","last_updated":"2026-05-21T08:47:56Z","snapshot_observed_at":"2026-07-06T23:07:14.243878Z","submitted_at":"2026-04-22T15:15:32Z","title":"The Expense of Seeing: Attaining Trustworthy Multimodal Reasoning Within the Monolithic Paradigm","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T10:35:50.838150Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.20665"},"observation_digest":"sha256:2ca5c3dea9dcaf2585e7cd025480ce7fc18df13e7600ada7c7a4550b408a279c","observation_id":"0eb02fec-f321-4728-bf03-db7c1a25d8e8","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T14:36:29.666730Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:e7a7002784feed85910d569b2d38dd92b4275b070249f9b6e600b53b1bc36690","observation_id":"5cbe58c9-2535-4f0f-b992-fe8167643885","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.01402","last_updated":"2026-05-11T02:53:21Z","snapshot_observed_at":"2026-07-06T23:14:38.379875Z","submitted_at":"2026-05-02T11:49:03Z","title":"Injecting Distributional Awareness into MLLMs via Reinforcement Learning for Deep Imbalanced Regression","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-12T04:52:09.685243Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.01402"},"observation_digest":"sha256:b602116f0b2dbf9980522308eeec1a7bbe5612eddcb29d68be7790294e272972","observation_id":"f8c77675-e600-4f98-9826-bd26e24b018d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09693","last_updated":"2026-05-10T18:25:52Z","snapshot_observed_at":"2026-08-03T00:00:10.613016Z","submitted_at":"2026-05-10T18:25:52Z","title":"Do multimodal models imagine electric sheep?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T03:24:01.933339Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09693"},"observation_digest":"sha256:34a2f65322aad4e7b89945e2d772844a82aa663790dd1dd624ce8d8b5dd77c05","observation_id":"51fcbd8a-30ee-41a5-9c1b-2a117f04ae4d","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:54.053958Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:47b38e0d587bc77dcbd12c0828a7588bdc9481dd42300d1df8d9cab27099d75f","observation_id":"e69986e0-e556-419c-b975-eceda920f3c1","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.09883","last_updated":"2026-05-29T22:33:55Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T02:16:48Z","title":"The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T22:58:04.574536Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.09883"},"observation_digest":"sha256:e7e18259cec7ff9de722ed54b146493dc11f53af6a603f00821f5296284a1d4a","observation_id":"17c6eedd-5c6b-498e-9742-17acee3eae00","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:fed688e2205d608cf9582848b90fff641ec995c154ced57872c883a7611e1653","observation_id":"2eecc1b5-7e55-4014-b21c-e4c0d30ef38b","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.15672","last_updated":"2026-05-15T06:48:53Z","snapshot_observed_at":"2026-08-02T21:23:41.421731Z","submitted_at":"2026-05-15T06:48:53Z","title":"VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T20:14:34.739062Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.15672"},"observation_digest":"sha256:c7edd2622d8651b20b396711f3408236e562759ceddc1b75d3cdef0f399579d9","observation_id":"b2c596a6-d638-446c-a9c5-1e75c5c40fd1","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.17291","last_updated":"2026-05-17T07:08:14Z","snapshot_observed_at":"2026-07-06T23:28:21.395050Z","submitted_at":"2026-05-17T07:08:14Z","title":"Step-wise Rubric Rewards for LLM Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T13:30:36.529139Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.17291"},"observation_digest":"sha256:4497c50daed27f160e6fc4f6945920a9f13728ff5b8fc06d7055aec42b9e2551","observation_id":"5851d4f6-769c-4b6f-92e9-0d896e34dc6a","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.19130","last_updated":"2026-05-18T21:30:54Z","snapshot_observed_at":"2026-08-01T19:57:38.697860Z","submitted_at":"2026-05-18T21:30:54Z","title":"EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T12:12:45.251924Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.19130"},"observation_digest":"sha256:7f13c5694f6d0ccb5792c7ebc1fb182b4449fc11baa1b3c8060fa900157041dd","observation_id":"2127c17d-1a86-413a-9736-bdbbf64a8041","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2605.20942","last_updated":"2026-05-20T09:28:06Z","snapshot_observed_at":"2026-08-02T08:48:03.833409Z","submitted_at":"2026-05-20T09:28:06Z","title":"Bridging Structure and Language: Graph-Based Visual Reasoning for Autonomous Road Understanding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T05:25:20.511933Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2605.20942"},"observation_digest":"sha256:cf3bbdca006216c041af708efd9e72eb3488ea0de673acb6dd740cd57e69e265","observation_id":"04dbbbd5-7c41-42c4-8c80-707d31f8d328","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:efa23cc0938a0d4ed1a0bc4ca82bc8fc5b4f1bbcfec3ba6412f1c34ac8a05395","observation_id":"3ebebce8-606e-4713-9819-be895d60852c","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.01667","last_updated":"2026-06-01T04:19:50Z","snapshot_observed_at":"2026-08-03T01:20:45.755599Z","submitted_at":"2026-06-01T04:19:50Z","title":"ATLAS: Agentic Test-time Learning-to-Allocate Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:27:28.290178Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.01667"},"observation_digest":"sha256:42067a590f03e25e784e9f8b7fbd799a0bfede98db37eda55162413bffd493b8","observation_id":"187c584c-1f2d-406b-94cd-aa8f92e5307c","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.05497","last_updated":"2026-06-03T22:41:11Z","snapshot_observed_at":"2026-08-04T13:44:30.423961Z","submitted_at":"2026-06-03T22:41:11Z","title":"LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, \"Is Your VLM Smarter Than a 5th Grader?\")","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T06:39:08.246174Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.05497"},"observation_digest":"sha256:aa76338f73a56ac6ffbe8d9da93c31368a28a7b19e2e6669c7b9ab1826865101","observation_id":"abdb3657-0c8e-497f-a05f-882bf39451c9","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:077a50570c4a71775eec5a3a1819f9d0212c7bced9d868c5cff80848de95a661","observation_id":"381440d4-1561-4548-a217-0477d06c4de3","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2606.25319","last_updated":"2026-06-24T02:32:38Z","snapshot_observed_at":"2026-08-03T01:28:21.016328Z","submitted_at":"2026-06-24T02:32:38Z","title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-25T21:23:10.051805Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2606.25319"},"observation_digest":"sha256:685ac564fee298d97689581473ad075ea01909ce17df06d5419361e62e4ebe58","observation_id":"27ad2c73-da42-4e3e-a21a-860c8bceef53","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.00248","last_updated":"2026-06-30T22:57:43Z","snapshot_observed_at":"2026-08-03T15:00:12.134373Z","submitted_at":"2026-06-30T22:57:43Z","title":"Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-02T18:57:46.841456Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.00248"},"observation_digest":"sha256:565cf4ee33ab27914fcabf658dd1d727d2c82eebb375f20c8831ec00aa806568","observation_id":"dba8cbd6-253b-42d7-a467-25bf97e808a5","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-03T13:50:58.440025Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:aac5088645b310ce3a93e6000e16ea37cd9afc49afba23542dde517b6de27e83","observation_id":"71f17e32-ee9b-4509-b9e9-2e4ec44e263e","resolution":{"observed_at":"2026-07-10T09:37:00.825956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-14T05:37:19.632869Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-14T05:37:19.632869Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:3b81d7934474b60808798163e85636f276695533e17a52bf46e27fda5d4dabab","observation_id":"5f823fbd-a930-48f6-a4e3-720357328807","resolution":{"observed_at":"2026-07-14T05:37:19.632869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-02T07:01:19.711542Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11436","last_updated":"2026-07-17T15:34:16Z","snapshot_observed_at":"2026-08-02T07:01:12.417571Z","submitted_at":"2026-07-13T11:44:23Z","title":"The Ebb and Flow of Multimodal Focus: Scheduling Visual Relay Windows for Grounded VLM Reasoning","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:01:19.711542Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.11436"},"observation_digest":"sha256:73dc0436d7fa5ff291381c76918fd98287f022c2ad0f8ca48ae1f980a567f989","observation_id":"17b1b511-f44e-4f07-b535-a58fa7242f42","resolution":{"observed_at":"2026-08-02T07:01:19.711542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-01T21:12:03.005752Z","title":"Babyvision: Visual reasoning beyond language.arXiv preprint arXiv:2601.06521, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16165","last_updated":"2026-07-17T17:46:23Z","snapshot_observed_at":"2026-08-03T09:32:27.223381Z","submitted_at":"2026-07-17T17:46:23Z","title":"An Exam for Active Observers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:12:03.005752Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.16165"},"observation_digest":"sha256:087241a0f416cbad563b5f93ea584985ca8c992753dbeac1519ded601f8b2e3f","observation_id":"c4384486-1fbb-4686-9187-89c420c32b05","resolution":{"observed_at":"2026-08-01T21:12:03.005752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-08-02T11:50:20.183933Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24771","last_updated":"2026-06-10T13:33:10Z","snapshot_observed_at":"2026-08-02T11:50:05.833448Z","submitted_at":"2026-06-10T13:33:10Z","title":"RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-02T11:50:20.183933Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.24771"},"observation_digest":"sha256:7614a71479bd70e30d30bcb3d52ef3c5def7ea45697306c73cb93f59d08052f7","observation_id":"747b163b-6bef-4176-97fe-c820f1d48fc4","resolution":{"observed_at":"2026-08-02T11:50:20.183933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T05:01:28.838169Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.838169Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:a727aa70f6266a1a4873c36544e5c216ec30f8a7245a73e77eb485a3b0018ac7","observation_id":"d51a5525-1455-4600-a670-736d17b93e09","resolution":{"observed_at":"2026-07-31T05:01:28.838169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T02:45:28.580613Z","title":"Babyvision: Visual reasoning beyond language","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28595","last_updated":"2026-07-30T17:46:55Z","snapshot_observed_at":"2026-08-03T15:42:49.918444Z","submitted_at":"2026-07-30T17:46:55Z","title":"Beacon: Knowing When and How to Perform Agentic Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T02:45:28.580613Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.28595"},"observation_digest":"sha256:dfd7cf91381a2566ed674024ccee701d5a41446f0919143b6c4154a59b9641a9","observation_id":"52f1f3d1-c9a0-418c-9ea2-43d2dd02a6fd","resolution":{"observed_at":"2026-07-31T02:45:28.580613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.06521/citation-record","integrity":"/paper/2601.06521/integrity","json":"/paper/2601.06521/citation-record.json","paper":"/paper/2601.06521"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.254842Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.254842Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:823b2e114a62489c50a4bea59cd06860f8ebc9d7f094b094b878d8029df9e883","observation_id":"2de732fb-c481-4680-b05a-50591f5ae38a","resolution":{"observed_at":"2026-08-03T11:25:36.254842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.324358Z","title":"Lin Chen, Jinsong Li, Xiaoyi Dong, Pan Zhang, Yuhang Zang, Zehui Chen, Haodong Duan, Jiaqi Wang, Yu Qiao, Dahua Lin, and Feng Zhao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.324358Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:b31bfe788282e17ea03d7a7bc10517be821242452a2b6975cdaa217de8acb02e","observation_id":"bfb5f875-3479-4275-8e03-d259b1939353","resolution":{"observed_at":"2026-08-03T11:25:36.324358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.583244Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.583244Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:988da4f26d36f3fd350be792d6174b194c167119e24c4a847fd448b5878be9d2","observation_id":"801ef178-dbe7-43fd-9ae7-febbc2b9b640","resolution":{"observed_at":"2026-08-03T11:25:36.583244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00468","last_updated":"2025-02-27T15:10:56Z","snapshot_observed_at":"2026-07-06T18:38:59.090751Z","submitted_at":"2024-06-29T15:28:45Z","title":"MMEvalPro: Calibrating Multimodal Benchmarks Towards Trustworthy and Efficient Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00468","snapshot_observed_at":"2026-08-03T11:25:36.655028Z","title":"Scott P Johnson","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.655028Z"},"links":{"cited_paper":"/paper/2407.00468","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:da2235fb69ee5d02e803dfc4be05c15d82bbd072051308cfca993b3905eab68c","observation_id":"4af5246c-d98b-474a-b118-4a42e8a91ecb","resolution":{"observed_at":"2026-08-03T11:25:36.655028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.738689Z","title":"Accessed: 2025-01-09","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.738689Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:942059b56171fb9f1144be03ee2208600405043cef050e297fba2a01b4b60e42","observation_id":"d0e1e774-3d1e-47c6-846e-c86c5eabbe7f","resolution":{"observed_at":"2026-08-03T11:25:36.738689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-03T11:25:36.780815Z","title":"Guangming Sheng, Chi Zhang, Zilingfeng Ye, Xibin Wu, Wang Zhang, Ru Zhang, Yanghua Peng, Haibin Lin, and Chuan Wu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.780815Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:3966c89a72697d151d3bf11c628600cb48c4ba0b98e7e0bcedfb4934b4a1678c","observation_id":"d644983c-2a3e-4d98-8be0-1c4e66419cdc","resolution":{"observed_at":"2026-08-03T11:25:36.780815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T11:25:36.862991Z","title":"Core Team, Zihao Yue, Zhenru Lin, Yifan Song, Weikun Wang, Shuhuai Ren, Shuhao Gu, Shicheng Li, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.862991Z"},"links":{"citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:1a6e82bc208d1ac482a68dbe1b383ea412023dd08c5f5ee2d64b37c39fdb2473","observation_id":"bdaee791-7db0-4c97-bf96-ee1f340191ed","resolution":{"observed_at":"2026-08-03T11:25:36.862991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-03T11:25:37.014871Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset.arXiv preprint arXiv:2402.14804,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.014871Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:09b1407283b4978260a374980f278bb82d75d7bb2d571a040ed20f2b29b462d7","observation_id":"fc4343a4-c7c2-4d2a-a26e-0760b32da638","resolution":{"observed_at":"2026-08-03T11:25:37.014871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-03T11:25:37.086374Z","title":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.086374Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:3065687fba2bb788fa3232664a741e1e504a3071b8bb58d7c667fd1b227ecd9d","observation_id":"f743877f-9b8b-4328-956c-c8e6acb7a2e5","resolution":{"observed_at":"2026-08-03T11:25:37.086374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24173","last_updated":"2025-05-30T03:33:25Z","snapshot_observed_at":"2026-07-06T21:33:26.575526Z","submitted_at":"2025-05-30T03:33:25Z","title":"DrVD-Bench: Do Vision-Language Models Reason Like Human Doctors in Medical Image Diagnosis?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24173","snapshot_observed_at":"2026-08-03T11:25:37.168330Z","title":"Drvd- bench: Do vision-language models reason like human doctors in medical image diagnosis?arXiv preprint arXiv:2505.24173,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:37.168330Z"},"links":{"cited_paper":"/paper/2505.24173","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:020dd20e820970dfa6c925a1fd48502d6f696cf55f5ebc5d7cfcf70a6e10bb4f","observation_id":"e54c4f02-70dd-455d-bed4-3f1f0daa5138","resolution":{"observed_at":"2026-08-03T11:25:37.168330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-03T11:25:36.947259Z","title":"Glm-4.6v: Open source multimodal models with native tool use, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.947259Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:bd768df15efd18d52595a9f63515f55ae14d90a9d03bcaa48dcfe00ffdfa98c7","observation_id":"241372c7-3494-44a1-a7be-4c5019d3e86e","resolution":{"observed_at":"2026-08-03T11:25:36.947259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T11:25:36.510939Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.510939Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:24cfce6b60c0eb8e63e0722cceb0a5b76e29f3fb46aba6ee503a3177dfe0bec1","observation_id":"4882c10a-7f71-48fa-8989-421a225fdd51","resolution":{"observed_at":"2026-08-03T11:25:36.510939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T11:25:36.210179Z","title":"Renée Baillargeon, Elizabeth S Spelke, and Stanley Wasserman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:36.210179Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.06521"},"observation_digest":"sha256:84161fe1993a71d5ce55952114e17d6351dc2efff674069fe28dadb0377dc9c0","observation_id":"768ad5cf-84db-4e70-a90b-7928f392fe03","resolution":{"observed_at":"2026-08-03T11:25:36.210179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 28 inbound Pith citation observations for arXiv:2601.06521."}