{"as_of":"2026-08-07T03:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9556db7bec2885b4bbd1c35ff7a5b38f9925e88d8acd2c13356d6b6309a0faf9","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:10:04.003151Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T07:59:34.398439Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19728","snapshot_observed_at":"2026-07-12T07:59:34.398439Z","title":"Vla foundry: A unified framework for training vision-language-action models.arXiv preprint arXiv:2604.19728,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02646","last_updated":"2026-07-02T17:59:52Z","snapshot_observed_at":"2026-08-06T20:06:02.812543Z","submitted_at":"2026-07-02T17:59:52Z","title":"EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T07:59:34.398439Z"},"links":{"cited_paper":"/paper/2604.19728","citing_paper":"/paper/2607.02646"},"observation_digest":"sha256:90554e6335de967f30978d3434940df6dbc7e76cf58674d26a1819009bbe94dc","observation_id":"b7927a69-cb4f-48f4-899d-5e17cc498f62","resolution":{"observed_at":"2026-07-12T07:59:34.398439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.19728/citation-record","integrity":"/paper/2604.19728/integrity","json":"/paper/2604.19728/citation-record.json","paper":"/paper/2604.19728"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.5879544.url:https://www.github.com/eleutherai/gpt-neox","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72fcbd9a-832b-4df1-97bf-aeabb51f70d7","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f8bfc5ef9fecbd36be324e12abab5ad23c094f0c7b8318db90bbf2f07b5f1325","observation_id":"ea607541-9413-499d-85b3-8815c89bfc14","resolution":{"observed_at":"2026-05-10T02:11:57.131161Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2308.01390","doi":"10.48550/arxiv.2308.01390","metadata_source":"pith","pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","venue":"cs.CV","work_id":"87bfa84a-e663-4165-806f-93ef439d88d0","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:3151c9e8571050f6a45f38658f9ab785dc39062224e960b0bf2d6d2b0986e868","observation_id":"0fbe3b42-b226-4d74-abe7-042978b5e16d","resolution":{"observed_at":"2026-05-14T01:52:01.553388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:742ab4b180808a707e02b301753245d8d378af0fefc94a9228f8cabbb7515b0c","observation_id":"28f079a4-8f65-475c-8533-f39ce61f595a","resolution":{"observed_at":"2026-05-11T13:16:03.855195Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:9d128a5e791dc440bde8c5775233dc95f51cc38c7037be07393745064868e9d4","observation_id":"9dd1efbf-0e68-4447-9f05-4bb2b5418fb3","resolution":{"observed_at":"2026-05-11T13:16:03.996550Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Foundation Models for Robotics: Vision-Language-Action (VLA)","venue":null,"work_id":"c74ad104-79c0-4206-9714-a60c3e92df0e","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:206d45a012debddb27313e171727656088d53d7db9c94bcab565da48fde8cdf3","observation_id":"a9e21c89-a13c-4a77-b12d-b316867609e5","resolution":{"observed_at":"2026-05-23T00:32:19.332957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/biomet/34.1-2.123","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Significance Tests for 2×2 Tables","venue":"Biometrika","work_id":"f9aa74cf-24db-4fab-9b2b-dbd200bc0098","year":1947},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:a111fb6117fc5b742cd0674c9f4bda2097d697707c956ddda3978d4d831831a1","observation_id":"76213249-7ab4-4db6-af80-3ddd55fe4b7c","resolution":{"observed_at":"2026-05-10T02:11:57.127105Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:c8df154f70d0f90e152469cc0fc939e9e41a57183299d30dd0c46f2909b595be","observation_id":"d821026d-71c4-4cde-812f-b6ba517dae05","resolution":{"observed_at":"2026-05-11T13:16:04.091270Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PIQA: Reasoning about Physical Commonsense in Natural Language","venue":null,"work_id":"bf1dc662-bf45-445d-8f49-c67dba20df12","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:422c10ab99478de0fffffc80f6d4c5e52c0f7a6ad0aa07158356451cd36edb16","observation_id":"4c3989b4-c1a5-483f-8861-3037353f988d","resolution":{"observed_at":"2026-05-23T00:32:19.282531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020.url:https://github.com/webdataset/webdataset","venue":null,"work_id":"6fd4e12f-4168-4cdb-a462-6106ed2c729a","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:dc79309f35e90c1cd3c9cbfab3e7c3437af533eb5b30c7327af1003c3a04e7d4","observation_id":"9c6622af-bcd9-4cba-8892-a952e108816a","resolution":{"observed_at":"2026-05-23T00:32:19.272116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/huggingface/lerobot","venue":null,"work_id":"4babd23b-8623-4ba0-bebf-ef1381e1bbe5","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f417d28352417d39942f04974b9e2c2e314f7a634b2f12a7690266e0066d0787","observation_id":"13acab17-d69e-4a21-afef-c53e52d157cd","resolution":{"observed_at":"2026-05-23T00:32:19.305456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":"1504.00325","doi":"10.48550/arxiv.1504.00325","metadata_source":"pith","pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","venue":"cs.CV","work_id":"b3d6fb46-4169-4a28-8f7e-2ca6774211da","year":2015},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:d9b369d6656ff067eddfa13f2f4be3155b86e3c38f4e5f5a8b872f9cf7ee2e5d","observation_id":"0d3419f0-c575-48a1-bb60-db89462d6476","resolution":{"observed_at":"2026-05-12T21:38:19.742717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"fbf08bb7-6bce-44ee-be3f-dbc67303fb36","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:b67298a6b1da9c1409fff2431654256a5559db7ea8bb32b9cad0c1c39240112a","observation_id":"3f477b18-1d24-451d-b1f6-d46f466ef165","resolution":{"observed_at":"2026-05-23T00:32:19.335743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","venue":null,"work_id":"beba468c-6fc0-4fbf-831b-bfe1146fffa1","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:8fcf6fddaa93e3d72555091cfb99b7b57c2370ed42e912772232cf90218577f3","observation_id":"ec706d37-b11e-48cc-92b1-ae883020a880","resolution":{"observed_at":"2026-05-23T00:32:19.280063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1300","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"B ool Q : Exploring the Surprising Difficulty of Natural Yes/No Questions","venue":null,"work_id":"b0eff16f-bbcd-4d66-a41d-d89ff07a80e5","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:9091df7241cb9fa45c8545b61f8daa57220897846ae723367b4af48abf3191b2","observation_id":"ccd39185-3a9f-49b6-b2f0-6de84b2f7f42","resolution":{"observed_at":"2026-05-10T02:11:57.133216Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T15:19:26.94061+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T15:19:26.94061+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:b3ae95b98c845e430a0f70941f7e8e0e7dc918242fc92cc5a48f608bc41b1c8b","observation_id":"bc4ecee4-8a3f-413d-9c3f-2ddd8dfa9420","resolution":{"observed_at":"2026-05-11T13:16:03.848833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":"2310.08864","doi":"10.48550/arxiv.2310.08864","metadata_source":"pith","pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","venue":"cs.RO","work_id":"62f0fb6c-e6ae-4dc4-95a4-d9dd64b240e8","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:589c09b812c3784838512f330a1f0e5f53661b31acfbbb77eb2f5e15477e8a0b","observation_id":"3675c2c8-2123-4777-828e-b04f2c3feb5a","resolution":{"observed_at":"2026-05-11T17:23:25.503833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.05014","last_updated":"2026-04-06T17:59:21Z","snapshot_observed_at":"2026-07-06T22:53:51.418227Z","submitted_at":"2026-04-06T17:59:21Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","version":1},"cited_work":{"arxiv_id":"2604.05014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.05014","snapshot_observed_at":"2026-07-10T07:26:54.478996Z","title":"StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing","venue":"cs.RO","work_id":"e9be5436-00f8-4b43-b82a-ff154145e079","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2604.05014","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:a9e9388c36436310053a828f0fee5da87b8f6da73b20ca098f4377363cedbf86","observation_id":"4362aebc-e716-42b8-bb85-377c90947597","resolution":{"observed_at":"2026-05-11T13:16:03.908151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"14c4688b-a160-42de-a7d4-a910594bb351","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f356fbb60f8718e88abc11121f1c3252cd01f30328d1c17ff796252600d8eb51","observation_id":"5c6753e4-3d10-4b80-87d7-53a16454e1bb","resolution":{"observed_at":"2026-05-23T00:32:19.284935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0f739170-0086-4371-a7e7-f857b3f6d019","year":null},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:652813365190e076da81dbdf74797c0e05c2a40599297210f9156a0dcee7d592","observation_id":"870cc89e-5d11-445b-8d3f-a67e005b1af5","resolution":{"observed_at":"2026-05-23T00:32:19.239770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:70275bc8df4df2c751423144687e63cc7dcd22e275f163c9a5dcb746bf48336c","observation_id":"ce099ebb-fd41-459c-8e46-c331399344e3","resolution":{"observed_at":"2026-05-11T13:16:03.866165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.04023","last_updated":"2019-02-11T17:57:38Z","snapshot_observed_at":"2026-08-06T23:53:40.967164Z","submitted_at":"2019-02-11T17:57:38Z","title":"Computing Extremely Accurate Quantiles Using t-Digests","version":1},"cited_work":{"arxiv_id":"1902.04023","doi":"10.48550/arxiv.1902.04023","metadata_source":"pith","pith_arxiv_id":"1902.04023","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Computing Extremely Accurate Quantiles Using t-Digests","venue":"stat.CO","work_id":"e7e4a062-e775-4688-8a6b-4be343201a92","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/1902.04023","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:4489d5df13ecd7b3830ed7cec483c50774f94adb753bae0f2f8eac68950e971f","observation_id":"2bf5c679-0649-43de-bb65-cb6034c54482","resolution":{"observed_at":"2026-05-11T13:16:04.062403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/EGalahad/vla-scratch","venue":null,"work_id":"233e4377-7752-49b8-9006-e2a955d3208c","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:fe46a86aecb342cc7439e4a268cabecac80c4ffe671f61197607b28024ed4015","observation_id":"991e7bda-d5d4-44f6-bc59-db48965075ed","resolution":{"observed_at":"2026-05-23T00:32:19.287651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"7fa07374-c305-440c-a2aa-5faed7baa978","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:22332d6a69c76d64210c6329823d57ee94a35611c88cd5b808a9eb55e35a6dbb","observation_id":"aa642ddd-5521-465e-9a6c-762f10cff35f","resolution":{"observed_at":"2026-05-23T00:32:19.300111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub repository","venue":null,"work_id":"39b356af-573b-48ff-8a35-5b56b8076b10","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:b9279d33c225256fe6e7e0b364f918d813054d34c7e3268c69f51f1a8024d13a","observation_id":"7f4e4d39-b429-479e-bfcb-1fec9291fbbc","resolution":{"observed_at":"2026-05-23T00:32:19.317503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":"c24e3cf0-b2d3-45bf-84b0-7aa583490aef","year":2021},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:697d6570f692c7697b8723feed2142d05cf19c19feb601b46b77910c3e08509a","observation_id":"b2a17e78-dd03-4e7c-bd03-79ef045c28d0","resolution":{"observed_at":"2026-05-23T00:32:19.266753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":"2404.06395","doi":"10.48550/arxiv.2404.06395","metadata_source":"pith","pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","venue":"cs.CL","work_id":"f20a4304-bd39-414a-923b-d18322e29258","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:c6bf81e4416a411289830427719951e64142bd17332a0f10e49ca58eb8a1d294","observation_id":"267f65ac-1b43-4d6f-8b8d-68edf4aacab4","resolution":{"observed_at":"2026-05-13T18:00:53.610624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:3bdee2ae314712ab990b0992d1a1d7411645653d6098c439e7a18dd26e742e3a","observation_id":"6652028f-4e83-400d-befa-54fc04374327","resolution":{"observed_at":"2026-05-11T13:16:03.871739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","venue":null,"work_id":"0875641d-fc55-4259-b1ab-55f424063c5f","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:6fcc8e93fb1fa8cca2067eb1e1999cce26a46c5d7826556b04750b50617304fb","observation_id":"3123b62c-1a60-42c4-a81f-7441fc476163","resolution":{"observed_at":"2026-05-23T00:32:19.269499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022.url:https://github.com/karpathy/nanoGPT","venue":null,"work_id":"5c38fce4-6e4c-43e9-964e-ed6ddc76afae","year":2022},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:c13485ee8d146c198b357f73bc9d79260c0d5727b2a6d4e8a2cdecef98cbfbb9","observation_id":"3d401fb1-0db9-4d33-a6c0-3e2d3cd6482d","resolution":{"observed_at":"2026-05-23T00:32:19.296755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07603","last_updated":"2025-03-10T17:58:19Z","snapshot_observed_at":"2026-08-04T07:24:00.037189Z","submitted_at":"2025-03-10T17:58:19Z","title":"Should VLMs be Pre-trained with Image Data?","version":1},"cited_work":{"arxiv_id":"2503.07603","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.07603","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Should VLMs be Pre-trained with Image Data?","venue":null,"work_id":"663c0644-79a4-4418-abd6-e818b263e493","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2503.07603","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:02470c3d3068e571fd3ebe928254241b9cc713d262142ee5b92284aa52cdcaec","observation_id":"ab335f5b-d315-4d77-bcdd-89df223d3f85","resolution":{"observed_at":"2026-05-11T13:16:03.883147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:0a74cc505279b0b1d9c75022536d44d000058bdfa90eaadfa5f98732b7c97f15","observation_id":"7f2f86cc-aed9-4c2c-b487-3e1348db3107","resolution":{"observed_at":"2026-05-11T13:16:03.964134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed: 2026-04-17","venue":null,"work_id":"f65a2205-7c0f-419d-8053-7fe618ebbb6f","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:7544012289f853ae7c95a0eabc1227f7381adae21d4214062322fd031b8b8f5c","observation_id":"df9aba8f-78a7-452d-8c4e-900914c589b9","resolution":{"observed_at":"2026-05-23T00:32:19.324638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":"2508.07917","doi":"10.48550/arxiv.2508.07917","metadata_source":"pith","pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","venue":"cs.RO","work_id":"b59f318b-3e24-4914-8f24-2de331bbb6c5","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:8d65a0433e1b3f6287e62a82884d41ebfb1c117b3d88d516429a4d8fd05644f6","observation_id":"c0b14bd0-dd95-485b-b510-dcd6c1042149","resolution":{"observed_at":"2026-05-14T23:35:23.409560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":"34aad93a-9e1d-4b77-8139-52fcb610d999","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:50da9ab3760912e5b9fe5310ba753bff85732077d7c27bcf0363901ee40b5a2c","observation_id":"0d7ea2ce-a2b3-452d-931f-b5da856b1830","resolution":{"observed_at":"2026-05-23T00:32:19.260742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:4314d4c102b2f5da01517cfb4cd2d0da60d656e043f680a7df8bcacb1ba8ac76","observation_id":"d6e513e0-612d-4c25-ad64-7f4ceb783114","resolution":{"observed_at":"2026-05-12T00:10:50.405848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:28:31.803123Z","title":"A systematic study of data modalities and strategies for co-training large behavior models for robot manipulation","venue":null,"work_id":"2914c6aa-5a4a-44eb-8e37-2b9466c70969","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:575ef1d8e11c3a756aae1f3fafd3d0d9e327b5bf26710e585af9ae3f51aa3381","observation_id":"ad49dc81-b19e-4516-93cc-26705d8433dd","resolution":{"observed_at":"2026-05-11T13:16:04.025910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12062","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T10:26:10.991036Z","title":"HoloBrain-0 technical report","venue":null,"work_id":"ae9c3bee-5775-4997-a93a-47049c7cab3e","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:55ffc5e7e87d749e36d09af29ccc158f28066ccf41eaa852fdaf0d73b0b22821","observation_id":"409854ad-10ee-4259-bf1f-dfb88c4186c0","resolution":{"observed_at":"2026-05-11T13:16:04.036982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:2487fe651034ab6c168b00e846e6c00efa936c951f3ae9a448cae58a641180de","observation_id":"33dc2a24-1749-458d-9c8a-785a535f3fa7","resolution":{"observed_at":"2026-05-11T13:16:03.815742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning","venue":null,"work_id":"6c5eeabd-d571-470b-b6e5-9c0cee79432b","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:bc18ef1b9b95110d90508a7ffed503784a2989a473591a1e979b7d942df2049c","observation_id":"c17ec488-2d1c-4c80-857d-e6565dbb98ea","resolution":{"observed_at":"2026-05-23T00:32:19.290409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07124","last_updated":"2025-01-17T09:39:17Z","snapshot_observed_at":"2026-07-06T20:20:09.958277Z","submitted_at":"2025-01-13T08:26:43Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","version":3},"cited_work":{"arxiv_id":"2501.07124","doi":"10.48550/arxiv.2501.07124.url:","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07124","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch","venue":null,"work_id":"79d80020-6168-4641-9e8d-a139574e92cb","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2501.07124","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:565ae18a535b45f758b5420f7c75ceaaa63f37caef8570fe7b48fd04ec870b12","observation_id":"3fceb114-49db-44b3-8a73-7bad8b49d944","resolution":{"observed_at":"2026-05-10T02:11:57.125399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-07-06T16:59:56.350207Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":"2312.06550","doi":"10.48550/arxiv.2312.06550.url:https://arxiv.org/abs/2312.06550","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2312.06550 , year=","venue":null,"work_id":"7debad57-109d-4e9f-929d-38e8237922f5","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:28ae506059e5d6db442992f566749181fa40759cd1f1519482ea0335cbdfec46","observation_id":"b2dd82f8-3a94-4a13-b64b-b5b948ca86d8","resolution":{"observed_at":"2026-05-10T02:11:57.135983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05299","last_updated":"2025-04-07T17:58:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T17:58:57Z","title":"SmolVLM: Redefining small and efficient multimodal models","version":1},"cited_work":{"arxiv_id":"2504.05299","doi":"10.18653/v1/2025.acl-long.718","metadata_source":"pith","pith_arxiv_id":"2504.05299","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLM: Redefining small and efficient multimodal models","venue":"cs.AI","work_id":"810cc87f-f6bd-4443-9673-5e30982426b9","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2504.05299","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f3a46b83dc5e361122dc9adda9ffa582794736925123bdb20acd96cb84a068ce","observation_id":"d23fceb5-745b-4ea1-9b2d-99a0b26eac8e","resolution":{"observed_at":"2026-05-13T20:23:51.804797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"68ccd00e-6c41-4ac6-88bf-52ecca7b8f6d","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:598420e3b0febaf3a28485871d44b9e54593874a99ab4bebf58662c20f6b6105","observation_id":"3eba369d-038c-4eb3-804d-ba2930fae3e9","resolution":{"observed_at":"2026-05-23T00:32:19.293296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/d18-1260.url:https://aclanthology.org/d18-1260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":null,"work_id":"65b45ad1-1fcf-4122-adf0-7d6554ebc629","year":2018},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:ee7163406983ee82176e0274c1c61bb7a7126a7bc7b8f68937842654d436c731","observation_id":"3d892be4-552c-49dd-bb9c-f5db7b37fc97","resolution":{"observed_at":"2026-05-10T02:11:57.140586Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ray: A Distributed Framework for Emerging AI Applications","venue":null,"work_id":"8f0062d3-3db4-45fc-801d-dddf235d94ea","year":2018},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:fc886fcb2ca80aea58e4d2913ad158dc7c38da138040302b727d13a9235e6a96","observation_id":"bd462d5c-6b26-443e-9765-faaea284d324","resolution":{"observed_at":"2026-05-23T00:32:19.302795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5350fd74-cd15-43d1-8f26-0486a756d182","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:08dbab4ac18aaa8e641550318f556a0587c02de8ce619eee33b7c703e99884d9","observation_id":"8f295ee3-0460-41eb-8701-2c3d6cc9184c","resolution":{"observed_at":"2026-05-23T00:32:19.309179Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":"2503.14734","doi":"10.48550/arxiv.2503.14734","metadata_source":"pith","pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","venue":"cs.RO","work_id":"e2db69c7-ee8a-4cb7-a761-7b8de1dfcf97","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:6ff9c44907dd5644787574a49958bf92ff4a0dde689e78e8f8c82761bc494cf3","observation_id":"1a182c20-f464-43ed-b91c-cbec9897249a","resolution":{"observed_at":"2026-05-11T13:16:03.981588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T08:49:11.206777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:3f2e0020c4bb81c5bcf041220a523ff9cfe5bbd199ce097fdb91a27520fa11c2","observation_id":"0590d8bb-0790-4ca6-805c-7a099cf5eda8","resolution":{"observed_at":"2026-05-11T13:16:03.926360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":"dda80d81-bdc1-430c-8762-c1646c869f65","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:64e25ce34ad04afa68028b4683b2ad2f8eaaa0e46024a5d1af52009a5b18303b","observation_id":"43ecea01-a308-4e09-8273-83e0d2222555","resolution":{"observed_at":"2026-05-23T00:32:19.327451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/nepfaff/drake-blender-tools","venue":null,"work_id":"ac21bf15-4c00-458b-bd7e-d3b135647b83","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:8da054b880af287c7952f76320e3c194368a363ed19b81c442679fbb9cd86bb2","observation_id":"563b84a0-e4f1-47ed-abb9-dd1190b25286","resolution":{"observed_at":"2026-05-23T00:32:19.330158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub repository","venue":null,"work_id":"bb93bcf0-80ef-4332-b539-c46c347042fa","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:cb75278fe8c48df2be0d227b2967de9f68e7ae6eaa64e85c8aba6de74a34a013","observation_id":"5ea3b885-cb35-48c8-a5ec-0c2d0e4f3d9c","resolution":{"observed_at":"2026-05-23T00:32:19.258242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:364d25e00ce2e7f55aa55aa6b5e73a2f83f7450eb05a4f5e5cac21eb08ac7d1a","observation_id":"a3a97002-b69d-44b5-b1a7-472819870261","resolution":{"observed_at":"2026-05-11T13:16:03.975504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":"2511.14759","doi":"10.15607/rss.2025.xxi.128","metadata_source":"pith","pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","venue":"cs.LG","work_id":"7c1b3355-694a-44c6-880f-631e897e1713","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:1d0bad574481ce238489273e0f636d9aece7cd8276b97ac06eeac9668881bc11","observation_id":"79dc5373-be84-473e-ba4a-68b154ed655c","resolution":{"observed_at":"2026-05-11T13:16:04.018345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An algorithm for a letter-based representation of all-pairwise comparisons","venue":null,"work_id":"8727d86f-04a1-48a1-82af-fe331674d7c9","year":2004},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:d13d7638a4c1d12ed741d6800d10027aa90dbc13b2041b0d087db6a964d6dfd5","observation_id":"34e953d2-8b38-4dd4-8ff2-33339b620bd0","resolution":{"observed_at":"2026-05-23T00:32:19.312220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f59fb329-213a-4c61-91ee-fc66cd86ecc2","year":2021},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:530ca34ba27aeb7ed6d80a758b7424e016be7f7ff9651024bcaa22dbf3c15e0c","observation_id":"a1bd9aa2-04f6-416b-98ee-42c666bd7f75","resolution":{"observed_at":"2026-05-23T00:32:19.274623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manning, 2024.isbn: 978-1633437166","venue":null,"work_id":"faee4f0f-6d42-4b60-8284-958522a3319b","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:79b8d1c5dc8825b2c5ead72ee34f96d9c92d3ffe9905a4122b32458a25208bf7","observation_id":"2518daef-95c7-47bf-9e99-3f576caa9316","resolution":{"observed_at":"2026-05-23T00:32:19.277507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4486.340670","doi":"10.1145/3394486.3406703","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rasley, S","venue":null,"work_id":"52f55323-65eb-41a7-98a5-66b140fe13ee","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f9c69feeb785c0fee1a0976bdb5dbdae06f71ecccb2293a3c497dde0a28f9a56","observation_id":"82272919-f7c8-41a2-affe-8abbec3749fc","resolution":{"observed_at":"2026-05-10T02:11:57.138780Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:49:48.952669+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:49:48.952669+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":null,"work_id":"2fac0688-11eb-4269-b350-3b3ad72bc80b","year":2020},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:ddac0b80ddb24f36b40767ef2f5e562109de51afec072a65234f2f7147b701a7","observation_id":"7513b13e-38a7-41ea-aaa7-660737b15e44","resolution":{"observed_at":"2026-05-23T00:32:19.321056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024.url:https: //github.com/ServiceNow/Fast-LLM","venue":null,"work_id":"de7be3df-3e23-4c8e-bdb0-38f0fd3f456f","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:d4f08c085cf86fb248eb3b82f64901b96a3fbec1f0d163d19f2b582c995a8f43","observation_id":"1a17e312-15df-405a-93b2-2b60b661360f","resolution":{"observed_at":"2026-05-23T00:32:19.232086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","venue":null,"work_id":"0de08ead-e2af-4bba-8539-410da8458000","year":2016},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:fb87130581e5f0d5a6f1e6f23de8f33f8c46376a755920c578aaf588f33c912e","observation_id":"3eee2fd4-e2e2-49cc-a433-812ce41d7eda","resolution":{"observed_at":"2026-05-23T00:32:19.228975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:0daa202a49c05efe77532a5a87d52cb581c7b225cdc00da438090d048a65e9e4","observation_id":"3564188d-df00-4ff2-b7e2-5672777733c0","resolution":{"observed_at":"2026-05-11T13:16:04.002704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":"2506.01844","doi":"10.48550/arxiv.2506.01844","metadata_source":"pith","pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","venue":"cs.LG","work_id":"0c5e9314-5fa7-4613-ad12-605a71d561d2","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:33dd05f046500b3a305e0a7745bd971c5591c266a46746b18b6f4572846f4bdb","observation_id":"01dc065e-13dc-44b0-9930-15e5508da823","resolution":{"observed_at":"2026-05-11T21:22:37.721356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":"2508.10104","doi":"10.1055/a-2487-1252","metadata_source":"pith","pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv3","venue":"cs.CV","work_id":"c8b07deb-8fe7-4e18-9620-f3569d3529ce","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:6d82d9f82277e4fe1ce911bd2dc9c8b8799533b3dec3c0b80c6115e73b4e9a19","observation_id":"106c0a77-2643-4bb3-9f47-3df54c9f5fc7","resolution":{"observed_at":"2026-05-11T13:16:03.793832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is Your Imitation Learning Policy Better Than Mine? Policy Comparison with Near-Optimal Stopping","venue":null,"work_id":"69fec054-d91a-4fd7-b9df-efb3936727d7","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:aeb2e9f11b585c07b76e9ebacf4778b7a1d1dc5e2627b29267c32d8a58c50661","observation_id":"4848d4c8-bc38-4298-ae1f-53eb97487984","resolution":{"observed_at":"2026-05-23T00:32:19.251827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Big little lies: A compendium and simulation of p-hacking strategies","venue":null,"work_id":"59646a91-b6ec-4ac8-9197-7c3818bb30f5","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:01ad3d567b693ce265f1367a50246abb4239722969f8cc00f36c50956327a829","observation_id":"723359a7-04b9-4800-af29-a28cd10e934e","resolution":{"observed_at":"2026-05-23T00:32:19.242948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":"2507.05331","doi":"10.48550/arxiv.2507.05331","metadata_source":"pith","pith_arxiv_id":"2507.05331","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","venue":"cs.RO","work_id":"a6923092-ec5d-4c9c-aa05-96009ad1e9a7","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2507.05331","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:5b01a81d3ee55c97b98a6bf3665acebb38e63315629f8bd025698c5309b27fab","observation_id":"6dbafd0d-1e2d-4d47-a33d-683189868e09","resolution":{"observed_at":"2026-05-25T04:32:56.991484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toyota Research Institute","venue":null,"work_id":"67f70816-2fd2-4715-90ce-a6d9e18d6bb5","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:6d249d09b9d4f11e3bb1fe6735d7cf1380bbb135572bd483c1796dac8e555e41","observation_id":"0811941d-d34e-4a50-892b-ed10804ce04d","resolution":{"observed_at":"2026-05-23T00:32:19.315024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:4bf26c40923fa6cf34e1e06ac082d4155f970164121ef39d0140540d389a4b6c","observation_id":"a982e4b2-d84c-4450-b3dc-126bfb722028","resolution":{"observed_at":"2026-05-11T16:50:29.153357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019.url:https://drake.mit.edu","venue":null,"work_id":"de24315a-fff9-4257-a1ff-51b5268d3f96","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:4c7b527b1ee8039a52cd3189f30ec3fc76e8024c1b0f2c75ba2cf4986539270a","observation_id":"f275805c-db75-4332-80ae-f2236c1b998b","resolution":{"observed_at":"2026-05-23T00:32:19.246049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GitHub repository","venue":null,"work_id":"a0873e0b-9c5b-41a5-9692-8f891d97829c","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:3105873a3093b76a456bb368031c4629b67fe6a09e895b454caaac77fb149661","observation_id":"1d59fd8e-a717-47b5-ac00-d5c499006182","resolution":{"observed_at":"2026-05-23T00:32:19.249014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fe562980-37a2-43b2-a99b-952e10050975","year":2024},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:4305e041b1a6d69a48e9a6de661e4ca683bf401cab865a57e3bb11e65a4be991","observation_id":"6e4cb887-27aa-4e56-834d-92344c03c98c","resolution":{"observed_at":"2026-05-23T00:32:19.234476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.23511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:57:32.215426Z","title":"Dexbotic: Open-source vision-language-action toolbox","venue":null,"work_id":"c0cac887-58bd-4459-9a05-3f01cc340c8e","year":2025},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:ba41ff9c21d0d94080e66d62984c872c73d29418185535d2f32cf83ff82b273e","observation_id":"c7769bf4-f229-437e-b6d9-241d3a75ee81","resolution":{"observed_at":"2026-05-11T13:16:03.838811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:14ef420647cb627e2db0a0d9cdcb64a98d97df3181e6044cd843f543a51e1844","observation_id":"c7c378db-cbb9-470b-a50a-f8512867cd83","resolution":{"observed_at":"2026-05-11T16:18:16.286837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:a730fa209971aa82875ee77fb89d51f5436b12e912c33289b0f2eb89be6f197a","observation_id":"894d1ed0-5869-4069-9a89-ecf8d900cdd3","resolution":{"observed_at":"2026-05-10T02:11:57.129366Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"8c8885fb-a025-4de1-9fd8-68bb1250e238","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:2ab4b4ad7bcfbc675cad83fbbfbd943bac5bf73178d805d1e5d68081e1922519","observation_id":"ac30ec90-586d-4df4-9f7a-2ce04e090ef0","resolution":{"observed_at":"2026-05-23T00:32:19.338788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","venue":null,"work_id":"1985d9b9-8719-4dba-a2b2-1909a409b80b","year":2023},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:c3e8763b82ef60f599e166c40a5a0879d81b0135fbaf3cfaccc18666d13a8422","observation_id":"76621654-bdf7-43d0-8496-03f14b427c02","resolution":{"observed_at":"2026-05-23T00:32:19.237497Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the Continuity of Rotation Representations in Neural Networks","venue":null,"work_id":"f77197e7-6787-4c04-86ad-1603bf726397","year":2019},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:a5e68d170f0f0fe4d887a411a1eb1443ca08f273c14d3db42ab2a181c17cafc1","observation_id":"8201eb28-43bf-456b-b6b1-5d3c83b3e5a0","resolution":{"observed_at":"2026-05-23T00:32:19.255535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2933e4f1-705e-4142-9fb7-c84932b18c8e","year":null},"citing_paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T02:10:04.003151Z"},"links":{"citing_paper":"/paper/2604.19728"},"observation_digest":"sha256:f970c76d7b6a170ba7f6da37aef3f38dd0de994e21ed69b73786105ed68e6c7d","observation_id":"60ad49a7-19f9-4b68-acc7-3070df3d44f7","resolution":{"observed_at":"2026-05-23T00:32:19.263772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.19728","last_updated":"2026-04-21T17:51:51Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T03:27:51.613115Z","submitted_at":"2026-04-21T17:51:51Z","title":"VLA Foundry: A Unified Framework for Training Vision-Language-Action Models"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":6,"verified_exact":36,"verified_fuzzy":32},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 1 inbound Pith citation observation for arXiv:2604.19728."}