{"as_of":"2026-08-13T00:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0fd603317aaa795c82af2833d25b0d1e8966cc73874854929738272006ce15c0","coverage":[{"denominator":147,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:27:18.375394Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T07:28:20.248452Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T07:33:07.543757Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"cited_work":{"arxiv_id":"2412.06845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06845","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7b fully open source moxin-llm/vlm–from pretraining to grpo-based reinforcement learning enhancement","venue":null,"work_id":"4add7a55-26da-4779-ad27-59ae39e761fd","year":2024},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":225,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2412.06845","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:c5b6809af8553ac8a1cec82e2d0d5e31047a0675af9b9897a4f01f202af1cc7a","observation_id":"6e2ddd1e-3c4d-49ab-bc90-28ed41baa203","resolution":{"observed_at":"2026-05-10T08:12:26.076291Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"cited_work":{"arxiv_id":"2412.06845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.06845","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"7b fully open source moxin-llm/vlm–from pretraining to grpo-based reinforcement learning enhancement","venue":null,"work_id":"4add7a55-26da-4779-ad27-59ae39e761fd","year":2024},"citing_paper":{"arxiv_id":"2605.19242","last_updated":"2026-05-19T01:28:52Z","snapshot_observed_at":"2026-08-06T22:30:04.170402Z","submitted_at":"2026-05-19T01:28:52Z","title":"PhyWorld: Physics-Faithful World Model for Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:28:20.248452Z"},"links":{"cited_paper":"/paper/2412.06845","citing_paper":"/paper/2605.19242"},"observation_digest":"sha256:3b87232e83cd5fff9d8ca5bdb5ea2723846d52e61b4a75d07ad3b2554ee3ca6f","observation_id":"bde30324-447d-45fa-b538-054dd951d0a9","resolution":{"observed_at":"2026-05-20T07:33:07.545335Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.06845/citation-record","integrity":"/paper/2412.06845/integrity","json":"/paper/2412.06845/citation-record.json","paper":"/paper/2412.06845"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T20:27:17.908700Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.908700Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:018eff1cdb59045fac4028f58ac94f703516ab6481fde88cc271168824bcbe23","observation_id":"9cbc60f7-5b3e-44b4-8633-1a7323d305a5","resolution":{"observed_at":"2026-08-11T20:27:17.908700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.913900Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.913900Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:39d2bf9f087da10f4bd44d8d74bc03f2955cb1195917ff9cf0fea9bd67080038","observation_id":"f9025085-c100-493b-b23c-4e41eb1fffc7","resolution":{"observed_at":"2026-08-11T20:27:17.913900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T20:27:17.917864Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.917864Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2a92f7e074aceb11bf31f0b315bf34fa247143bc0d8fa74ca36d3586890550b3","observation_id":"7d826f12-3d0b-4108-bc29-4d7e2e867748","resolution":{"observed_at":"2026-08-11T20:27:17.917864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T20:27:17.922529Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.922529Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f68f9033684e8bae285a1deff1d7ac78cad09b6015eb448e816347a7bc854085","observation_id":"10ed27de-30c5-4417-88a0-505435db5fb8","resolution":{"observed_at":"2026-08-11T20:27:17.922529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.926903Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.926903Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c70fedc92bf711cf6d78f5a2d245d61bf174273fb04e842b7aee890fde9bedc1","observation_id":"59d72586-8095-46da-9571-cc457a7d749f","resolution":{"observed_at":"2026-08-11T20:27:17.926903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T20:27:17.931276Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.931276Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:98c0cb5917bc074a9a09521fe7feb855a145009397fc29c1cef642a79c0afe77","observation_id":"d39dd68f-bab5-4011-b266-6092d5b56fb3","resolution":{"observed_at":"2026-08-11T20:27:17.931276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12941","last_updated":"2023-10-19T17:39:02Z","snapshot_observed_at":"2026-08-06T00:13:50.302132Z","submitted_at":"2023-10-19T17:39:02Z","title":"The Foundation Model Transparency Index","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12941","snapshot_observed_at":"2026-08-11T20:27:17.936174Z","title":"The foundation model transparency index","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.936174Z"},"links":{"cited_paper":"/paper/2310.12941","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:5b61a9a020f8b0868659c0b60b8feef23790432bf826a91d9abe1f7d64de9f75","observation_id":"0e7dc88a-ffcf-46c6-a8f3-42447b5e2d04","resolution":{"observed_at":"2026-08-11T20:27:17.936174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07918","last_updated":"2024-02-27T16:49:53Z","snapshot_observed_at":"2026-07-06T17:43:31.874919Z","submitted_at":"2024-02-27T16:49:53Z","title":"On the Societal Impact of Open Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07918","snapshot_observed_at":"2026-08-11T20:27:17.941292Z","title":"On the societal impact of open foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.941292Z"},"links":{"cited_paper":"/paper/2403.07918","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:d33f5976cc5db842770b17a8b49e00cac25bca4f9b770bc2c17d139529b93971","observation_id":"ec3858cf-c5b1-48e2-b6a7-c71243e7a492","resolution":{"observed_at":"2026-08-11T20:27:17.941292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13784","last_updated":"2024-10-18T08:20:22Z","snapshot_observed_at":"2026-08-12T01:57:11.354452Z","submitted_at":"2024-03-20T17:47:08Z","title":"The Model Openness Framework: Promoting Completeness and Openness for Reproducibility, Transparency, and Usability in Artificial Intelligence","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13784","snapshot_observed_at":"2026-08-11T20:27:17.946278Z","title":"The model openness framework: Promoting completeness and openness for reproducibility, transparency and usability in ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.946278Z"},"links":{"cited_paper":"/paper/2403.13784","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:cd693541433a127ec7c47ac94ad932e63ee41d3c00c8c0eab1fca030c0473d88","observation_id":"ba54148c-97a0-4644-892b-25d38fb8fca1","resolution":{"observed_at":"2026-08-11T20:27:17.946278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T20:27:17.950661Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.950661Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:995553b7b9e45d6d2ec882e04a9a918edb815095fb547b88393232ac626d3e3e","observation_id":"9c83d35f-f71a-4a7c-82e8-248a2b1f7bcf","resolution":{"observed_at":"2026-08-11T20:27:17.950661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T20:27:17.955582Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.955582Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:11ac1d8c038bc8db86dbe9a63d84d6fab1ca6b710978f14427b0a691e0703ce0","observation_id":"b66b9e42-7f90-4201-a427-1221c33f8bfd","resolution":{"observed_at":"2026-08-11T20:27:17.955582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04066","last_updated":"2026-04-30T01:02:16Z","snapshot_observed_at":"2026-08-04T23:15:30.344058Z","submitted_at":"2025-01-07T12:12:46Z","title":"Federated Knowledge Distillation for Multi-Model Architectures Lithography Hotspot Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04066","snapshot_observed_at":"2026-08-11T20:27:17.960659Z","title":"Fedkd-hybrid: Federated hybrid knowledge distillation for lithography hotspot detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.960659Z"},"links":{"cited_paper":"/paper/2501.04066","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:9453c53069259fba8dab8aa76dc52f2ba8b96a3f41478f1e36c948d1fef13c6f","observation_id":"4b706cb5-2ab7-4e62-b10e-82f0109fbff9","resolution":{"observed_at":"2026-08-11T20:27:17.960659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.971474Z","title":"Advancing model pruning via bi-level optimization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.971474Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:7be9516b0b4ac82b5ee86fac14713762fb948c2df15b2777276feda1ea8b3874","observation_id":"959ccb6b-a24b-49e1-b2ad-e26ec2abd7c5","resolution":{"observed_at":"2026-08-11T20:27:17.971474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.977240Z","title":"A generic layer pruning method for signal modulation recognition deep learning models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.977240Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:ae7d6d3ad066b9f97936de68e3dc4f36f654936d5bf1e7c1da36210ed73d1e99","observation_id":"4326f0a1-abea-45fc-ae30-070bf34095b7","resolution":{"observed_at":"2026-08-11T20:27:17.977240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.983689Z","title":"Cross-layer graph knowledge distillation for image recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.983689Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:0f6230c6f2e44ab4ede21893b9415beaa3395589650db84e2c982c12b65b58ea","observation_id":"c9dee28d-ff30-4c0e-a0fe-cc5122462b92","resolution":{"observed_at":"2026-08-11T20:27:17.983689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.988351Z","title":"Peeling the onion: Hierarchical reduction of data redundancy for efficient vision transformer training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.988351Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:970cfaefdaf4321db4db28de74b197b6bc3bcbc0ae436bff2f05aa73d4544da4","observation_id":"6a9bef99-2617-4551-90e3-a2535d9c6b07","resolution":{"observed_at":"2026-08-11T20:27:17.988351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.992180Z","title":"Pruning foundation models for high accuracy without retraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.992180Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f213d16d6b9f28353d86b0e213494197cec0770830f7260f45afd2bba58aaada","observation_id":"bbca38c9-3d9b-4605-a7d5-db71898fbbef","resolution":{"observed_at":"2026-08-11T20:27:17.992180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:17.996883Z","title":"Sparse learning for state space models on mobile","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:17.996883Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f11d590a482ce5f64a52d009d1f8fa6629b0b8912ae49ee6f9fad2dcf4300913","observation_id":"8c30e468-be81-41a1-8e39-76f2099b05ec","resolution":{"observed_at":"2026-08-11T20:27:17.996883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.001431Z","title":"Numerical pruning for efficient autoregressive models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.001431Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2f55cc3c6557b4219642329b13b09ad6a2e9003da3b19f0e94b7ca9491433f3a","observation_id":"ec0d0054-bb58-4d51-82b0-73d668d2164b","resolution":{"observed_at":"2026-08-11T20:27:18.001431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.006447Z","title":"Lazydit: Lazy learning for the acceleration of diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.006447Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f1027c7275ce3b9e4b8c79b9e1f6aaf3b10daa80fb13038af6a2f137b8c582b8","observation_id":"7ed4b091-0e04-4683-a625-60f728b84202","resolution":{"observed_at":"2026-08-11T20:27:18.006447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.011095Z","title":"Toward adaptive large language models structured pruning via hybrid-grained weight importance assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.011095Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:97b1fc1050d73f5db4681964131dea68ad737e38894afe232dfeb8bd68b7c72a","observation_id":"d071bf78-c14c-4c64-93ae-0314752c9376","resolution":{"observed_at":"2026-08-11T20:27:18.011095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.015275Z","title":"Search for efficient large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.015275Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:19139aaca21f2dd2fb754b03ad8ee1f225845727d5513aa87b80239456a5a5d5","observation_id":"db35236b-feb4-4bfb-876d-72d7da0919dd","resolution":{"observed_at":"2026-08-11T20:27:18.015275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.020380Z","title":"Pruning parameterization with bi-level optimization for efficient semantic segmentation on the edge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.020380Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:8818922976db107023836f88f5f6e890be85b1ca08620ceb2a162786df4ba3f1","observation_id":"ac3ec23f-a669-4a1c-aa0a-de67d80a8e05","resolution":{"observed_at":"2026-08-11T20:27:18.020380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16424","last_updated":"2025-05-19T09:20:49Z","snapshot_observed_at":"2026-08-12T03:02:11.856038Z","submitted_at":"2024-02-26T09:22:57Z","title":"COMAE: COMprehensive Attribute Exploration for Zero-shot Hashing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16424","snapshot_observed_at":"2026-08-11T20:27:18.025591Z","title":"Comae: Comprehensive attribute exploration for zero-shot hashing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.025591Z"},"links":{"cited_paper":"/paper/2402.16424","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:fa3a43c50ae88083c953e8b9e5ebf25dc199988886c04fb45e9cc6bf1d9f832c","observation_id":"a11a1879-0bbe-4ada-9530-a6752987ee55","resolution":{"observed_at":"2026-08-11T20:27:18.025591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.030590Z","title":"Quartdepth: Post-training quantization for real-time depth estimation on the edge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.030590Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c6082564325d2154aa1099990f9c8e8bfce5e6c634de06efa8c53a53a81e555d","observation_id":"836a6ad3-4c45-4f51-ad9f-eb9fb609cf32","resolution":{"observed_at":"2026-08-11T20:27:18.030590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.036705Z","title":"Fast and memory-efficient video diffusion using streamlined inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.036705Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:ef45f058676bcb62698292f1caafc702f4aff2fa2e4007af417d9a620e35eb57","observation_id":"1ca5c2dc-61b6-40b8-8eec-023d89028509","resolution":{"observed_at":"2026-08-11T20:27:18.036705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.041450Z","title":"Compiler-aware neural architecture search for on- mobile real-time super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.041450Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:715a563385f5d9e671c44b47c7735b3d32718d2bb8b4e621e76b80cf655c9da0","observation_id":"da6348e0-ea44-47de-86f4-2c0607a1c85b","resolution":{"observed_at":"2026-08-11T20:27:18.041450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.045575Z","title":"Achieving on-mobile real-time super- resolution with neural architecture and pruning search","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.045575Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:b4d90eaae5169ca354627813b4ed0e85cbab8ff2a472572cdf493021b37fc719","observation_id":"929d0e0c-8283-478e-a49e-002c0d2ba333","resolution":{"observed_at":"2026-08-11T20:27:18.045575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.050052Z","title":"Towards real-time segmentation on the edge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.050052Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:19aa9759fe424768635b1596df138fa890d08c5591b7cc29b31e46dc62e59399","observation_id":"7264bf81-3b07-44dd-bf05-e01b7502d36d","resolution":{"observed_at":"2026-08-11T20:27:18.050052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01198","last_updated":"2022-06-02T17:58:54Z","snapshot_observed_at":"2026-07-06T13:16:54.118645Z","submitted_at":"2022-06-02T17:58:54Z","title":"Pruning-as-Search: Efficient Neural Architecture Search via Channel Pruning and Structural Reparameterization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01198","snapshot_observed_at":"2026-08-11T20:27:18.054852Z","title":"Pruning-as-search: Efficient neural architecture search via channel pruning and structural reparameterization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.054852Z"},"links":{"cited_paper":"/paper/2206.01198","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:8b3259217c2b25e82b9bc4774247bea7107d8e26cfe5e922da5b956375a51071","observation_id":"b344b1a0-2f93-4d9c-a25c-9ba8614f0daf","resolution":{"observed_at":"2026-08-11T20:27:18.054852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.060294Z","title":"Exploring token pruning in vision state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.060294Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:59e3cb3a23f10ae7ecc3aca5a60cfe1e7e8e644ae9a265abb25231aa76d8aa93","observation_id":"08e43dbf-ec4b-4690-940b-9eb3386b4d71","resolution":{"observed_at":"2026-08-11T20:27:18.060294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.064480Z","title":"Rethinking token reduction for state space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.064480Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c20e6a03134673dd324067db06ff62571f483cecc1a9cd9d8aff3fc6c3767496","observation_id":"dacccc1f-49ac-4d78-afed-0c74e58f5741","resolution":{"observed_at":"2026-08-11T20:27:18.064480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.068696Z","title":"Spvit: Enabling faster vision transformers via latency-aware soft token pruning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.068696Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:fbd2b5a87d36842346cd225ff8626df645010fd172bdcc46453b4c930d54d5d1","observation_id":"b7bc951a-ed9f-4c89-b642-45ebfe351496","resolution":{"observed_at":"2026-08-11T20:27:18.068696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19201","last_updated":"2026-05-04T05:23:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-31T15:10:29Z","title":"Efficient Reasoning with Hidden Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19201","snapshot_observed_at":"2026-08-11T20:27:18.073656Z","title":"Efficient reasoning with hidden thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.073656Z"},"links":{"cited_paper":"/paper/2501.19201","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:d2f7b3a3f2852f9fa26531b957d4c563a603a0c2bd4db1396a3a3993aa6062e6","observation_id":"ab345c5d-4ba3-4cfe-8ce0-d16d64e0386c","resolution":{"observed_at":"2026-08-11T20:27:18.073656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23844","last_updated":"2025-05-28T16:24:50Z","snapshot_observed_at":"2026-08-09T20:58:51.092258Z","submitted_at":"2025-05-28T16:24:50Z","title":"Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation","version":1},"cited_work":{"arxiv_id":"2505.23844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23844","snapshot_observed_at":"2026-08-11T20:27:19.647836Z","title":"Enabling Flexible Multi-LLM Integration for Scalable Knowledge Aggregation","venue":"cs.CL","work_id":"9b5237c7-87b3-47b6-96d0-3df9e3c1f699","year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.078272Z"},"links":{"cited_paper":"/paper/2505.23844","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:29d09602c2577204fd6c96a44a291fb74e7343c417dbadf076ac42b631c71c37","observation_id":"3abd59c6-13e2-419f-9512-6fc54eaa7876","resolution":{"observed_at":"2026-08-11T20:27:19.658885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14709","last_updated":"2025-05-17T05:00:39Z","snapshot_observed_at":"2026-08-10T23:13:38.822956Z","submitted_at":"2025-05-17T05:00:39Z","title":"FastCar: Cache Attentive Replay for Fast Auto-Regressive Video Generation on the Edge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14709","snapshot_observed_at":"2026-08-11T20:27:18.082776Z","title":"Fastcar: Cache attentive replay for fast auto-regressive video generation on the edge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.082776Z"},"links":{"cited_paper":"/paper/2505.14709","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:30fda2bec41d7eafbb3ae15463656cd18ca533705a256c87ee93a442b09e21ce","observation_id":"d008724c-d0cd-40ac-82ac-18c98ba5a5d4","resolution":{"observed_at":"2026-08-11T20:27:18.082776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18399","last_updated":"2025-05-23T22:05:59Z","snapshot_observed_at":"2026-08-09T10:26:44.569352Z","submitted_at":"2025-05-23T22:05:59Z","title":"Taming Diffusion for Dataset Distillation with High Representativeness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18399","snapshot_observed_at":"2026-08-11T20:27:18.088114Z","title":"Taming diffusion for dataset distillation with high representativeness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.088114Z"},"links":{"cited_paper":"/paper/2505.18399","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:84e2a1b817fd6c1dee583f916ac394636cacf8b381e3373ef3ef2c589c3cd73a","observation_id":"1ff82d57-1316-4469-8488-c44a09c98adc","resolution":{"observed_at":"2026-08-11T20:27:18.088114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-11T20:27:18.092971Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.092971Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2b61f886be7ea8c463ed22ae5dd16e117175c20372c7acb022595fafa6580542","observation_id":"c9f477e5-0d08-4c4b-aa69-b690855049c3","resolution":{"observed_at":"2026-08-11T20:27:18.092971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12570","last_updated":"2024-08-22T17:38:59Z","snapshot_observed_at":"2026-08-12T22:59:06.564690Z","submitted_at":"2024-08-22T17:38:59Z","title":"Jamba-1.5: Hybrid Transformer-Mamba Models at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12570","snapshot_observed_at":"2026-08-11T20:27:18.097840Z","title":"Jamba-1.5: Hybrid transformer- mamba models at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.097840Z"},"links":{"cited_paper":"/paper/2408.12570","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:e6cf916e0d849f34fa6e652183a1e75557bee4b1eb0ead0f9f21bea9003803f3","observation_id":"b7abe382-b2de-44fa-8b08-62d13f66f576","resolution":{"observed_at":"2026-08-11T20:27:18.097840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T20:27:18.103285Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.103285Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:0216bb07c3ebc2d2028228de57422d362eb9ead1a98618a56beb78e8aed665e3","observation_id":"fb18644c-6456-4998-95bb-4e0dba7e4456","resolution":{"observed_at":"2026-08-11T20:27:18.103285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.107814Z","title":"tiktoken, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.107814Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:1fb392fd89506ba2665914fe7f3fe7740e032b04a6667b5ec97d4c8b94f211e1","observation_id":"ed8036f4-53ab-4c7b-bc3e-bfabe73f3b56","resolution":{"observed_at":"2026-08-11T20:27:18.107814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06226","last_updated":"2018-08-19T16:49:06Z","snapshot_observed_at":"2026-07-06T06:56:20.935388Z","submitted_at":"2018-08-19T16:49:06Z","title":"SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06226","snapshot_observed_at":"2026-08-11T20:27:18.112010Z","title":"Sentencepiece: A simple and language independent subword tokenizer and detok- enizer for neural text processing","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.112010Z"},"links":{"cited_paper":"/paper/1808.06226","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:a839cb4176198d18dc00e9e72d298518d7a5ce3919cb261f32fe8f1ad55d7497","observation_id":"7d2336e0-a065-4959-a9cf-b398bcb0f0f1","resolution":{"observed_at":"2026-08-11T20:27:18.112010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-11T20:27:18.116490Z","title":"Xlnet: Generalized autoregressive pretraining for language understanding","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.116490Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:ce39858cc3df3b48d11804735e2d04b867ed79b41f53df4afcaa9a1051a2a15a","observation_id":"13db362d-04cd-4c7e-a853-44176c278e53","resolution":{"observed_at":"2026-08-11T20:27:18.116490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.120711Z","title":"Summary of the tokenizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.120711Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:e7af64a384b0d90fc6e29bb443207c7882528e39f587088e01c9b081bac63772","observation_id":"b0fe366e-4d9f-48f9-aac8-894e386fa23a","resolution":{"observed_at":"2026-08-11T20:27:18.120711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T20:27:18.126245Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.126245Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:4e52af79243555c08396cef17083a482306f040d733440f50baa9e07a0e77675","observation_id":"62274b73-20d3-4c2c-9611-9e441fe72d59","resolution":{"observed_at":"2026-08-11T20:27:18.126245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-11T20:27:18.130591Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.130591Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:945a5eaaa5de6780efffbed9612330f0da52f0c9dc2c3ff287026c8f6074554d","observation_id":"9de82e34-6ec3-4ffe-b736-97a01dcc7c2c","resolution":{"observed_at":"2026-08-11T20:27:18.130591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T20:27:18.135247Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.135247Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:74fee4c39ffe4c27bf67a1c1054709519cf18921fe8f2c867b58eaf7d4ac03c4","observation_id":"2946d674-5f97-4698-b98d-4e23395c60de","resolution":{"observed_at":"2026-08-11T20:27:18.135247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-08-11T20:27:18.140032Z","title":"Mm-llms: Recent advances in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.140032Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:d6e600a6e3115f9be57cd4eb730250c66900f0c2627eeb6893c884961a89c09a","observation_id":"966e4d78-04db-4a6a-b7e0-c018435e7efd","resolution":{"observed_at":"2026-08-11T20:27:18.140032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-11T20:27:18.144550Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.144550Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:6b318eb8b1b77107f757e2aff42c89f42be88072df2ccd1a72dcd0b6061d0522","observation_id":"5797e93d-968f-47a2-b402-e609358f855c","resolution":{"observed_at":"2026-08-11T20:27:18.144550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T20:27:18.148931Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.148931Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:3a6484832478a0178f8cbf29403d589bbc1a19a2f3518c7846f1fe415b571ded","observation_id":"8dd8301c-3c20-493a-bd46-97f7816b8fd2","resolution":{"observed_at":"2026-08-11T20:27:18.148931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01116","snapshot_observed_at":"2026-08-11T20:27:18.153116Z","title":"The refinedweb dataset for falcon llm: outperforming curated corpora with web data, and web data only","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.153116Z"},"links":{"cited_paper":"/paper/2306.01116","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:af86ed30da7f0f512773d1dac121e19d1aca3c86d4aa21bdec8d9963830b1627","observation_id":"cdb5b6d2-9fcb-493a-b2d7-ed5dc618b428","resolution":{"observed_at":"2026-08-11T20:27:18.153116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-08-09T14:52:01.161814Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-11T20:27:18.157473Z","title":"Scaling language models: Methods, analysis & insights from training gopher","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.157473Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:51770f77c70e499d36b88b804b96036cf55b02a119c1d98db4e72d73273eabb2","observation_id":"19f4fd42-2c78-4445-80a8-eb53c669554f","resolution":{"observed_at":"2026-08-11T20:27:18.157473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00359","last_updated":"2019-11-15T00:03:54Z","snapshot_observed_at":"2026-07-06T08:34:04.911718Z","submitted_at":"2019-11-01T13:09:28Z","title":"CCNet: Extracting High Quality Monolingual Datasets from Web Crawl Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00359","snapshot_observed_at":"2026-08-11T20:27:18.161664Z","title":"Ccnet: Extracting high quality monolingual datasets from web crawl data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.161664Z"},"links":{"cited_paper":"/paper/1911.00359","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:8da4ae88836e4851012dc73bcc9338138455b962c63f5b94c271bdf2511e6635","observation_id":"d74a08a5-22c9-4b86-8325-38d8a0183e85","resolution":{"observed_at":"2026-08-11T20:27:18.161664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11934","last_updated":"2021-03-11T18:45:13Z","snapshot_observed_at":"2026-08-09T05:32:57.900052Z","submitted_at":"2020-10-22T17:58:14Z","title":"mT5: A massively multilingual pre-trained text-to-text transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11934","snapshot_observed_at":"2026-08-11T20:27:18.166288Z","title":"mt5: A massively multilingual pre-trained text-to-text transformer","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.166288Z"},"links":{"cited_paper":"/paper/2010.11934","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2665a81595e3bb5898edb4036b71968ebe1a729c6e1e6537cf04514deeeebc99","observation_id":"35e4e164-1993-4a38-9b69-bff2f948200c","resolution":{"observed_at":"2026-08-11T20:27:18.166288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.170671Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.170671Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:bcd7f4f0a3b9e122ff308072b1167b43f56f8d57767a4d5012b77d4498f0b5db","observation_id":"5ed5ce60-564d-46d9-9747-a4faf0895b00","resolution":{"observed_at":"2026-08-11T20:27:18.170671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.175245Z","title":"Cross-lingual language model pretraining","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.175245Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:18a2019754ab09a35e38aec59d8fb2ba413f55eb73edc3af772b38b839b68b92","observation_id":"56e9ca47-cc5f-482b-9cea-4abce246ec51","resolution":{"observed_at":"2026-08-11T20:27:18.175245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T20:27:18.179395Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.179395Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:a742691ba36a4ee8e00c77547d5e3eda21116c4c204d588d7ca2c99b99c6afc1","observation_id":"ce2a3189-ff29-4dad-9d65-2d513948b7a8","resolution":{"observed_at":"2026-08-11T20:27:18.179395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-11T20:27:18.183453Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.183453Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:a5abe2e408f7be40d124430af4c5bb12290732e664c25205e0a23f4641c5e093","observation_id":"f14ca8d5-1167-43f2-98e1-b7b94c07df9a","resolution":{"observed_at":"2026-08-11T20:27:18.183453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-12T22:29:34.933447Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-11T20:27:18.187919Z","title":"How to train data-efficient llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.187919Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:41e39c59b7cce6eb652cf5bd92d0a5a72da33e4f3b8b9be2a60bce4bac659574","observation_id":"ec3b47f7-da73-41fe-a6ce-030286bc9153","resolution":{"observed_at":"2026-08-11T20:27:18.187919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13169","last_updated":"2023-11-13T14:50:06Z","snapshot_observed_at":"2026-08-12T15:01:41.972781Z","submitted_at":"2023-05-22T15:57:53Z","title":"A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13169","snapshot_observed_at":"2026-08-11T20:27:18.192841Z","title":"A pretrainer’s guide to training data: Measuring the effects of data age, domain coverage, quality, & toxicity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.192841Z"},"links":{"cited_paper":"/paper/2305.13169","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:afb5935cee8ded6b180121f70cafdaabf7974d2fe570c76fdf5e061db98392d9","observation_id":"8e2b32a2-7a26-473f-8553-26cf3fb73d34","resolution":{"observed_at":"2026-08-11T20:27:18.192841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.197752Z","title":"Glam: Efficient scaling of language models with mixture-of-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.197752Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2fb700895be119292246ffb7ad797d93e8026a00c48610331cfaa54235e80246","observation_id":"752f4963-cd4a-4c94-9156-ca9497cac1a6","resolution":{"observed_at":"2026-08-11T20:27:18.197752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-05T18:30:13.997811Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-08-11T20:27:18.202214Z","title":"Deduplicating training data makes language models better","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.202214Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f42212299a3c30ab92edeacd2915b3e61c0137126c95cfff05dfe8d4b65c3d7a","observation_id":"02b4b7f7-1d41-430d-a3ad-41511d2bedf1","resolution":{"observed_at":"2026-08-11T20:27:18.202214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.207533Z","title":"Url normal- ization for de-duplication of web pages","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.207533Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:e49fdf2b10dba51da27f9d106068e82d61895f73e40b0d5c773a088485f65b25","observation_id":"c0174190-2c29-4481-aaf5-c239ae7031a1","resolution":{"observed_at":"2026-08-11T20:27:18.207533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-11T20:27:18.212836Z","title":"Datacomp-lm: In search of the next generation of training sets for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.212836Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:fc090f69cbf5ad30b70082deefff3020f00f38a1a51f137864c203f8c8c77d75","observation_id":"93160288-adc3-4018-b45a-9c52bc69cee3","resolution":{"observed_at":"2026-08-11T20:27:18.212836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.217617Z","title":"Efficient online data mixing for language model pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.217617Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:b6d49f444d78429fab351319c25dc3cd5a13c5bbbdae2497854dedaba531ea91","observation_id":"f2dd4150-d875-4f87-a0d3-53cf7d538c23","resolution":{"observed_at":"2026-08-11T20:27:18.217617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10818","last_updated":"2024-05-09T13:56:06Z","snapshot_observed_at":"2026-08-07T23:26:20.937888Z","submitted_at":"2023-09-19T17:59:54Z","title":"SlimPajama-DC: Understanding Data Combinations for LLM Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10818","snapshot_observed_at":"2026-08-11T20:27:18.221452Z","title":"Slimpajama-dc: Under- standing data combinations for llm training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.221452Z"},"links":{"cited_paper":"/paper/2309.10818","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:ad50b4c6ffcc6d04d1121b7f5e56edbd12aeebc05852770485abc11866a260b1","observation_id":"2fdf681f-5d41-4609-807f-a96e95c0b2c1","resolution":{"observed_at":"2026-08-11T20:27:18.221452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-11T20:27:18.225753Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.225753Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:19677b4d5ea7437c9820a099f95440bd8551f82ac1ea018edb2b04cd20ac5ec0","observation_id":"bf06d7aa-c143-4e16-8ff2-bd72429e5d1c","resolution":{"observed_at":"2026-08-11T20:27:18.225753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.230402Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.230402Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:b7e68e704a800e0091e5df0b8779fafdb6e0895bb23c2dd8006d23c79903bbe4","observation_id":"bb1cfb66-2300-4402-a56b-9d649ed14911","resolution":{"observed_at":"2026-08-11T20:27:18.230402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-11T21:44:59.697120Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-11T20:27:18.234748Z","title":"Dolma: An open corpus of three trillion tokens for language model pretraining research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.234748Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:62b34293f6d5386b90ab02ffb0dd54850f680449d4c7a3d1945cd2c51016cb58","observation_id":"37066c23-d6cc-420f-a195-ed135180da2a","resolution":{"observed_at":"2026-08-11T20:27:18.234748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-11T20:27:18.243855Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.243855Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:6b5e8ae5278bbc0f634a7a0d34ab5fc03af919f31b8dd3f1209aa71a2ccc588f","observation_id":"06cd4c28-0fa0-4212-bf85-5c653126d384","resolution":{"observed_at":"2026-08-11T20:27:18.243855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.249188Z","title":"Llm-datasets: An open framework for pretraining datasets of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.249188Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:dbc0b140f7512b8692458cb536f1258963492d17b032e1ff8309cbd4b5ea8171","observation_id":"0620b97a-ff06-4107-9b0f-07d1517fe1eb","resolution":{"observed_at":"2026-08-11T20:27:18.249188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-11T20:27:18.254010Z","title":"Starcoder 2 and the stack v2: The next generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.254010Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:5cd24ab0942478772aa385f9dd1bf7f91b60777dc235d77eee86cc4cd715f037","observation_id":"de883fd8-b005-422b-8a3f-4e9b7727f7cc","resolution":{"observed_at":"2026-08-11T20:27:18.254010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T20:27:18.258465Z","title":"T \\\" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.258465Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:f74abbbe77461eea46602b1ea87118c1401b9cdfcae1d3697e279b87cd1b77ec","observation_id":"dff75c77-9380-4d3a-837e-7652698887c5","resolution":{"observed_at":"2026-08-11T20:27:18.258465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.262501Z","title":"Infinity Instruct","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.262501Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:39b5fa909820e0a1b2eac053258b184034e9cc447d450410e425dc373e34e40f","observation_id":"2f26dc05-8c6c-4aa6-a2fb-f4eb91b8330f","resolution":{"observed_at":"2026-08-11T20:27:18.262501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T20:27:18.266679Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.266679Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:5c033fbdd1c7c4356df298ea3665f649ed8464ddfe56fc3a678257aeacc63ade","observation_id":"fa758c31-56f6-4f35-ac65-29d3e288cb1d","resolution":{"observed_at":"2026-08-11T20:27:18.266679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.271271Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.271271Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:b5f392c34132846b62e4f748954a2517984a38c72a550a9fe7db9b2d1fbdbe0e","observation_id":"023814d8-389d-448b-84ee-33afc67d6a77","resolution":{"observed_at":"2026-08-11T20:27:18.271271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.275117Z","title":"OpenR1-Math-220k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.275117Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:ce1518f209989312521eacbc455eabaa2915c10a03e61c2a4b698103f7123fae","observation_id":"28bba9e2-7f7e-4f33-9e1f-ffaae0274b79","resolution":{"observed_at":"2026-08-11T20:27:18.275117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.279135Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.279135Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:5c2c5cd9bb030f63d306052679c154ab31985b1f68432bfa36667ff620cbb2f4","observation_id":"3ebb2631-8eb9-4d77-b7c2-40d75dfa6765","resolution":{"observed_at":"2026-08-11T20:27:18.279135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.283265Z","title":"Areal: Ant reasoning rl.https://github.com/inclusionAI/AReaL, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.283265Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c05763db1933e199da32e05a2ba5210f72e459ffd1a876f717f1ffdbbeec4cda","observation_id":"bc22fbdc-ae80-4eda-905d-b451cd60a763","resolution":{"observed_at":"2026-08-11T20:27:18.283265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14088","last_updated":"2025-04-24T13:24:42Z","snapshot_observed_at":"2026-08-12T23:38:37.764751Z","submitted_at":"2024-06-20T08:04:07Z","title":"ReaL: Efficient RLHF Training of Large Language Models with Parameter Reallocation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14088","snapshot_observed_at":"2026-08-11T20:27:18.287868Z","title":"Realhf: Optimized rlhf training for large language models through parameter reallocation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.287868Z"},"links":{"cited_paper":"/paper/2406.14088","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:3f318d3720429b6c7f175dde670bfdfe2679e3cbdc9cc3320dc626b9a589435c","observation_id":"23c34f15-0efb-47fb-978c-a4d69d38317a","resolution":{"observed_at":"2026-08-11T20:27:18.287868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.292130Z","title":"Gemini: A family of highly capable multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.292130Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:8d30daf7bcd922bdbc6f7d3704dc66416ec74271c7f56864e2e4b213cb122b4b","observation_id":"3d4264eb-14bd-4476-a0b6-568706d1e07b","resolution":{"observed_at":"2026-08-11T20:27:18.292130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T20:27:18.295971Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.295971Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:fc9f0c5bb18543632262f617e6864e616cbb6d64b67c4a0277dbea689596aabb","observation_id":"1000de85-5982-4acc-b44d-f827120fe87d","resolution":{"observed_at":"2026-08-11T20:27:18.295971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-11T20:27:18.301141Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.301141Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:6dbcf688a5d812184fe812eaf30929e019ae4784534fa0a8b34645f85a4b70a4","observation_id":"d1079219-1573-4a92-b259-054ff5840111","resolution":{"observed_at":"2026-08-11T20:27:18.301141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10305","snapshot_observed_at":"2026-08-11T20:27:18.305532Z","title":"Baichuan 2: Open large-scale language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.305532Z"},"links":{"cited_paper":"/paper/2309.10305","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:d4546c799e2a9ba650a7d88254bd4e7955b4cc58c5c0ac4c6ef615ac3b14b6a0","observation_id":"393e8302-5398-4bde-9bba-66ca674bfbcd","resolution":{"observed_at":"2026-08-11T20:27:18.305532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T20:27:18.310711Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.310711Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c9e37634fc8ce8f0268352b31e2e6862cefe1731797c3bca0c582e58da486366","observation_id":"77a95bc1-26f3-4888-8562-c411cbbd0479","resolution":{"observed_at":"2026-08-11T20:27:18.310711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.316066Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.316066Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:60e572b909bf24afa9aa16408e3860f7130f12bc6a0482e4d302e2e7b0fd13d9","observation_id":"b7ef42a6-fbdf-46e0-876e-e209d2d9e310","resolution":{"observed_at":"2026-08-11T20:27:18.316066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-11T20:27:18.321064Z","title":"Gpt-neox-20b: An open-source autoregressive language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.321064Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:650e5f40f89ee6b7cda1269dbbfc60e3132f9723552c060d5f0c9f9537de340e","observation_id":"008db99f-adc3-4d05-a74f-15144c4ff43f","resolution":{"observed_at":"2026-08-11T20:27:18.321064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-11T20:27:18.325609Z","title":"Olmo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.325609Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:946ab19e89062769a345e6e2c93058631c34a93cc9b24b468695471e9d29b5b1","observation_id":"f1c78cca-ad87-4ed1-8a20-8e592feeaa80","resolution":{"observed_at":"2026-08-11T20:27:18.325609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06550","last_updated":"2023-12-11T17:39:00Z","snapshot_observed_at":"2026-08-10T20:06:30.348234Z","submitted_at":"2023-12-11T17:39:00Z","title":"LLM360: Towards Fully Transparent Open-Source LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06550","snapshot_observed_at":"2026-08-11T20:27:18.330173Z","title":"Llm360: Towards fully transparent open-source llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.330173Z"},"links":{"cited_paper":"/paper/2312.06550","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:8079f53b6eb4a6787a08dcfa0050afacd0f6b827aaa6da72f3a52c95c0344a84","observation_id":"716216dd-7521-4f6d-b796-b0750c31e976","resolution":{"observed_at":"2026-08-11T20:27:18.330173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-11T20:27:18.334503Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.334503Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:16852373a324445228c5f922c4008327b7eaf9f711ab1a51a804e87314212c87","observation_id":"935359d0-c036-455e-8821-cb4cd580a93e","resolution":{"observed_at":"2026-08-11T20:27:18.334503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-11T20:27:18.338879Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.338879Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:358a75b3c098eaa936f433f0e12ecf3ce8f92ab75c767362e6c6c6c567dd1495","observation_id":"68d82c91-e340-4f6b-897e-961caa53a6da","resolution":{"observed_at":"2026-08-11T20:27:18.338879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-11T20:27:18.342788Z","title":"Longformer: The long-document transformer","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.342788Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:0a37e622dbb7283d2bd44707ad29ab0f44864d9febba11d579c3d1fa712a627b","observation_id":"4718b4d8-001f-4af4-969e-3465b1320517","resolution":{"observed_at":"2026-08-11T20:27:18.342788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.347059Z","title":"SlimPajama: A 627B token cleaned and deduplicated version of RedPajama","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.347059Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:3fadbdda3c011140094b5a844b68dab686d35ecf65df5bd593a9a471732cca48","observation_id":"7cebbe5d-20f3-4220-970e-e17274678b59","resolution":{"observed_at":"2026-08-11T20:27:18.347059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-12T17:33:55.030240Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-11T20:27:18.350792Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.350792Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:96008067f5f354ce6ceed519a60c47793f50cd2405654602e96838a09b2aa398","observation_id":"c2d8eb90-4199-4e43-8dfc-40bd293a72de","resolution":{"observed_at":"2026-08-11T20:27:18.350792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-11T20:27:18.355433Z","title":"Semd- edup: Data-efficient learning at web-scale through semantic deduplication","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.355433Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:9dbd9ebbbacbf9023d9c6ebf7a3bedc625fdfd779170777f23d7e8bf890bd34c","observation_id":"8bdf83a3-2eb1-41cb-9444-fbdf07e88c10","resolution":{"observed_at":"2026-08-11T20:27:18.355433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.359443Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.359443Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:6d2af4be7b4ca95468d413eb9ad5a49ce90db20fa3d993b41b6ffee4d3a4a083","observation_id":"311a437a-1c19-4b49-b689-4fbcbc90f178","resolution":{"observed_at":"2026-08-11T20:27:18.359443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-11T20:27:18.363229Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.363229Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:123f63779be79c5644968243ebe5ed02f1057b4bd602cc38db3a59965e17ebd5","observation_id":"f2363aff-4900-4b7d-b92d-26ea6bcf49b0","resolution":{"observed_at":"2026-08-11T20:27:18.363229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.367268Z","title":"Mining of massive datasets, cambridge university press, cambridge, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.367268Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:2d750ffb3ed6e75eb2d67001df25688cb1a46c46888814b24594c15c6ddaf12e","observation_id":"35079eac-4071-48cf-93c1-6f310ea1a06c","resolution":{"observed_at":"2026-08-11T20:27:18.367268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.371325Z","title":"Introduction to common crawl datasets","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.371325Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:03886d361b16702115fa4cb7cb57ebdc5c4ef42be75831efe0eb7361d8a4b6f3","observation_id":"9a76da83-df64-4bd0-8ebb-1f1acb6abffb","resolution":{"observed_at":"2026-08-11T20:27:18.371325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:27:18.375394Z","title":"On the resemblance and containment of documents","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement","version":6},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T20:27:18.375394Z"},"links":{"citing_paper":"/paper/2412.06845"},"observation_digest":"sha256:c57334d64f596aa16be1e5529521b29f44642302e044d3560c18b6e08bb21c94","observation_id":"e0125241-7206-4192-a342-6b63db95f694","resolution":{"observed_at":"2026-08-11T20:27:18.375394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.06845","last_updated":"2025-07-04T00:04:42Z","latest_version":6,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T22:29:58.744757Z","submitted_at":"2024-12-08T02:01:46Z","title":"7B Fully Open Source Moxin-LLM/VLM -- From Pretraining to GRPO-based Reinforcement Learning Enhancement"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":147},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 100 of 147 outbound references and 2 inbound Pith citation observations for arXiv:2412.06845."}