{"as_of":"2026-08-23T06:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfebe7b2bd0aecbd24aa189d1f581e7f9643376d322694688501d7245c99c83c","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T01:18:48.061500Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08973/citation-record","integrity":"/paper/2607.08973/integrity","json":"/paper/2607.08973/citation-record.json","paper":"/paper/2607.08973"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:dc84b6c8bfe7f3cee536942dc456d07e13149f1f4c370ae62c434a3b38387b17","observation_id":"82a406a9-52d6-4618-9441-a8c6c3f61f03","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:92c853160b5457fa6e243cba0fbb8a40b565e34a6160106714f97e5d4d0419ca","observation_id":"113db41e-bcf5-4938-a2e1-cc652dc8ac7d","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:99e578c5d9f2c6a0ba6bac2a4d2db06370cc2165637564201fa33777fdb415ae","observation_id":"b7ca7b8a-0d86-43c3-b3f3-8533e3f75a19","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05021","last_updated":"2017-07-24T21:47:51Z","snapshot_observed_at":"2026-08-17T23:05:43.968470Z","submitted_at":"2017-04-17T16:32:02Z","title":"Sparse Communication for Distributed Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05021","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/1704.05021","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:e05ed02004de38cd24654f3487b8e898522dabd5626f2b7e8f805af3024984b3","observation_id":"be1abf45-fb7a-4ea7-9e92-f00632b8be66","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:2aee002717d2e3344c08d3f5560006aaac54cebfaa28e2568ac06f4404fa8ce8","observation_id":"42aaef25-68d8-4e8c-b8b3-17afcf494e26","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:0f503f48d891f27cb0230c4e11474dca0fb5220071556298ef623939d1ea89c0","observation_id":"17c58692-a664-4e58-8458-7945008bd787","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:89b7375eac9c4a987da4d75df635c58807b77e38bef049589debcb7769a0df8e","observation_id":"d06068b3-761b-412a-9af3-a1b79eb4a54c","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":1985},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9d390c864d2197502edac1da7d79e22b72ff31037285948a37b9ae1dac719f0d","observation_id":"7cb58f6d-672f-4abc-aefc-742f7d04d9f4","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-19T20:59:52.967003Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:33006ec1d93247b3492124092afdafe3f6d9518f1ef9735903d42460064ea6c7","observation_id":"bbed7484-4fc1-4b72-ac3d-6708d4c2539b","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18403","last_updated":"2025-02-25T17:52:01Z","snapshot_observed_at":"2026-08-16T12:55:17.385362Z","submitted_at":"2025-02-25T17:52:01Z","title":"Kitsune: Enabling Dataflow Execution on GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18403","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2502.18403","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:e812643139a97d7d937e235d6842b17db6cba080eadeed9ca27aa7b92893f7f0","observation_id":"01359862-a08b-485f-acb9-6379c6462d77","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:641f57e32476f0c2bd2f503967010d969dccead04054cf146a82645629b6e3fc","observation_id":"45f694ed-1e76-40fe-afed-781c18df6b35","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:ca0397479c9875e62f3198b39b5f43cb8a631a01a5dd6e9444d176dea0076967","observation_id":"a38effbc-b6e6-4957-b112-6f722bd4f7c3","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:27527b5220271158604133a5a9f83eb5c3d9eaf82e409454da27532f6553d34b","observation_id":"927c3138-1d14-4d69-bc49-a35c0701eb8f","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9b7aea9437e9ec3e17e8f5bba79c1c031930a121c8fc616c4c3019871bab5a0f","observation_id":"3c4b67d8-7ca4-4ebf-a714-25ae8e75993a","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11556","last_updated":"2024-08-26T13:52:08Z","snapshot_observed_at":"2026-08-20T07:08:28.948134Z","submitted_at":"2024-08-21T12:07:54Z","title":"Understanding Data Movement in Tightly Coupled Heterogeneous Systems: A Case Study with the Grace Hopper Superchip","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11556","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2408.11556","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:c748aade4f847eb19280e906588bca45d2a63a02939379418acac6bb2fe2b1f6","observation_id":"34898497-baf3-40fd-b3e5-4f3c2b2414ee","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11329","last_updated":"2026-05-01T12:16:47Z","snapshot_observed_at":"2026-08-13T12:39:52.600804Z","submitted_at":"2025-05-16T14:53:50Z","title":"TokenWeave: Efficient Compute-Communication Overlap for Distributed LLM Inference","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11329","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2505.11329","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9ad853722bd8795fb747910c5437286d5a900399a847685fb847f07ead7a940e","observation_id":"e9a6cef8-2183-471b-b950-5d606dbb1bc2","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:70e5cfee012d1c2776ca75c81757ff047d926b4c9e81c23547bcb43fbe9c6b16","observation_id":"359e5825-0168-4704-8af5-021c89048ad2","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:98acb37de91fd6e4c6bc8495051c99f283511e27bb0d78bfffb52cf384ff3124","observation_id":"430f6423-dc60-4214-aa0e-bb410e9fcacb","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9cdfe6ce2f4582e2fd5ad4f8fee66521cb8df8612fb8e38c454c1691568ca67a","observation_id":"16337130-79e5-4f4c-86c9-64b1bc4cdfba","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b3e144ef352e888abd9a30dd501d65e984e9f5a90bd9d10ba7a2861cace86d2f","observation_id":"086990e4-945e-4732-b7c9-e8a5560626a3","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:d1f357c5d4d1fca8b28e9719862c3c68f385211dc7b477222d48fc3b6dc7d6c5","observation_id":"30545c67-ef09-4115-bfa4-2910127c7bb6","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:647e4df56799504bacc6cbf2074954a56b7ac6a1bb6534c527c122f116f8ebad","observation_id":"8714f165-8aec-4cc0-b741-70ee99d9d8e3","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:5e6339d6b01da5a280dd73d92b0dc47e0272b82126dddccb1ea221e18dfb7581","observation_id":"69ffafd6-8fb6-4ae4-adc3-f98972c4b737","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b03b89e337cf3c3d19d25bc461c48335c0253498d2b22871bf4c9e792d25d5f0","observation_id":"9ca12c99-0e11-4e77-bdc4-0209dff76a04","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:5de5e3e215f3a96b389c78bddb00a52938cacb363131fcebd9fc01f00e6f86bb","observation_id":"f45e3e54-dd90-4450-aae7-3722a9765720","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:95cb731d6ae3610a761c73c3dcd834125dba6a3dd8f97d945fb3c89d25008d59","observation_id":"b74560a2-325a-45a5-bae0-95b37c13d3fb","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14382","last_updated":"2025-02-20T09:18:53Z","snapshot_observed_at":"2026-08-20T06:25:36.145122Z","submitted_at":"2025-02-20T09:18:53Z","title":"S*: Test Time Scaling for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14382","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2502.14382","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:50e405ba463edb46e68f25dd4ab7008135bfed9c5cf9941db6cd8eb4b0646292","observation_id":"716ac33a-5f25-4f61-86be-23b70caba98e","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:d45a6af25ff017e74ee4379e039ccd1bad807edbce84abc22319cb7fd183f7eb","observation_id":"38169a16-42b3-4f92-843a-92a298c683f7","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:07ef8a1e542da12fc8bf34fdf866595f993ff9ed9cce1efbd6d802ca171da5d1","observation_id":"e7ec520c-63d9-498e-a539-276178b4b212","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:91655fd2ed4c071b234850b92e6dfe82cdf4d927d56d3f34431059897f9b8ba9","observation_id":"ec3c0015-1a4e-43cd-a48d-59fe720d6b9a","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:6e16373519a5343f94ce118a1f19e9f8c97b6dbae03cdd648706dba934556d2f","observation_id":"d7f7b706-341c-41c9-9b31-9f10c9d7dfc7","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:321f038fd66e5f62c45c8750cb5b55b579b6f8be9acb2be4a3daee510875ec2c","observation_id":"6e5c6346-fd3d-4bd7-9769-16f8feeb3100","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b8ee36ea66a3d91f90df7d2884f328469cea70b2ca97b45b13986c40108d4d61","observation_id":"b58aab43-5a66-420b-93cf-00015177a957","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9beceb343df94315f82b690c00011758778d6bb59a7ea52a4c4600cb8c2860f2","observation_id":"18e14673-bcbb-470f-aa6a-586e86536fae","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:6d5d3177e65eb7a105e062bae040b8872606361978572c8d6763fb1a83e0379d","observation_id":"25d04677-ef14-410c-9146-eb4de0f95435","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:d58b5bd7e36be7a2af613d86769b82e4f86d750efe40e05a9556e8b78e3ff47a","observation_id":"505727ce-d1c0-4d14-9a03-b0cc657babea","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:ab54f986b9100b950ed87e7132351a0aa356dfe1e00484f9c566e52a9ebc800e","observation_id":"33655ba1-3c95-4360-ba7b-33b4b3bc2dc4","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b25717cc5108bddeaaa6152119b22e41a271c81c11d2063404a8fc95f7d83f5b","observation_id":"0d343883-a6e6-4ae4-86c8-ebc479d9ad61","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":"Retrieved November 16, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:a2e1bc08c1ec3f693a3763268006a38af61b71ca568ee5095eeb172d5322e6de","observation_id":"3da595a7-7824-4d9a-9792-ffedcfb657b2","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:7266cee8c5445836e09fa3c8e72c090c27c1539670352bfcb7c22a4ca2acf7e1","observation_id":"94e7bd48-397c-40d9-8ceb-f9704ed69413","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b5929de272426e1e517f9e54fae3e4ab31fd66d20616ac02e72380b591844bd8","observation_id":"06b19c97-8cd4-4ea0-9382-10d5ba92b018","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:1d726956b4c34662407759821dc726525721c8b0698ceb5a57ea7da0a66faa03","observation_id":"ef04feca-c9d1-40dc-8381-f49f31fed823","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:c086c5f811759118f00e2a38618b6f9c9a5b0981e438f2a77623ffd87f53b104","observation_id":"84a4d333-8e83-4311-9300-c367e28f980f","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:c6e5178a51dd3e58dd0da8fc9e343c370041302addfed30d6ab07e770245a286","observation_id":"3c0172b5-59c5-4387-9882-9719716e4ec9","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:2fe80a9982a05c4b65cf12ef862eda8223880ae679a08478d6cdfedd31ebae2e","observation_id":"d24d1cbb-c705-48b2-904e-e62ff8549f1e","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b81a96d60f11b2c8d61e25ea8e820876cdf717ebbd7952f9591dad1e2209f3a9","observation_id":"ee7c0a24-62f5-4a17-8684-78a2c2d96304","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:e7117a4af4714452598f0f21ed941d42c72a77cecf3fe9577ba2c5e01ff67df7","observation_id":"f05960f3-03ab-4723-963f-66bac186644d","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:5df80e279ab055d67780032aa69f4d671af88dc675dcef4812b558458598c07f","observation_id":"793abed4-74b0-482d-8c43-28140b0467bb","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:3c338342e7ee78f05116a1e0ad70ea99321e5accf48ac93a5cd27ee8e6e32b53","observation_id":"21eb5e7f-2cbb-40c4-a246-dbb9f95807c8","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:eba8e62f275cd276db70e4cbaca29ca27cbc9697fd00c9aab8f4ffd3b28acced","observation_id":"47c87dfc-5b75-4cf4-8a43-87dbd4867032","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-08-16T14:37:33.548231Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:aff8141b9d3c03ad82acf155a02d029d5d01e7a3fcc0cc2aed478ebca7ca5c99","observation_id":"6ab65925-ce18-43bb-9fa4-9610abbea9cc","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:8696afd7e8c716ebe936f1a3f67eddd877e6670413d390b0976c78e3d1958020","observation_id":"267e16a6-49a4-45c0-9006-d4eaf5b5c795","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":"Retrieved November 16, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:50695b501ba7fdcbec27beef86423cdb0943ccce621c1f4704b4a16505013cce","observation_id":"68a6827c-6121-4980-8e02-4608eafd5af5","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:ba921334a96388ef0dcbfb2318a3c8f3772a4b0d8d7b7001f8a3addbaefcd386","observation_id":"a4cde3de-69a1-48d4-8d7c-4aa25517e586","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:f3289f4016b5dfbdf7dc9d8be97e2a2f73e09ef6565118e970ad04400350a7b3","observation_id":"8627866c-1851-47c4-a198-1e4f57a989c0","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9b4c226ed771d576f51d8f36781d49b8f724f733ecf50e769a04b4d439f8614f","observation_id":"fa068cf5-9ca1-4f87-9ae3-80cb262723ae","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:2e6e2da27dd93028b7d14af32b5e557b218abc482abc6064e79a3822f1293e4e","observation_id":"1507fb94-c23e-4fb4-9e36-6bf142917583","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:83cb7655bfd678941aa1c4fd3735b1b5fe17f0889f3d7cad83bf90dfdc296b7a","observation_id":"ec07305c-271e-481e-8f3d-60d4fae5cf0e","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:2fad68e969c8a2da5cd0eadae96a4c460819f605ea89a0ec9f0f2d66c5b2a83c","observation_id":"e1ba6bcf-3f60-4143-af75-c83728fc9118","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08192","last_updated":"2025-05-26T07:30:17Z","snapshot_observed_at":"2026-08-15T05:30:09.958930Z","submitted_at":"2025-01-14T15:14:10Z","title":"PRESERVE: Prefetching Model Weights and KV-Cache in Distributed LLM Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08192","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2501.08192","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:e322c0165c4bb79d10a32cf740aff32d2426f4ec86f0229876f208b5265e8385","observation_id":"1529728b-0318-4f9a-86b8-c9060c2498aa","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:9857d8d7c4aa20df19bc5f19f8c69789ecc3473ee6b2d4fff70912664f7bd70d","observation_id":"4bd84c73-5153-43aa-888f-4362a9c4481f","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:b5b43801172835242388e7133df388c1557ca876272143ef0b91564b6d49302f","observation_id":"9412b91f-4960-4dbd-bbf6-aee0ba0b596a","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:fe30bff9b24ac90d101b0c710da15a7e295c05cdc4fa7d707ea34d8f29ee5051","observation_id":"80c9be81-a755-42cd-9996-e4ef0490f874","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19442","last_updated":"2025-06-05T05:48:26Z","snapshot_observed_at":"2026-08-16T23:40:39.321894Z","submitted_at":"2025-04-28T03:09:22Z","title":"Triton-distributed: Programming Overlapping Kernels on Distributed AI Systems with the Triton Compiler","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19442","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2504.19442","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:54011cde220c949c475c51b94fac7ea774da82ebc51d870655ee1895128a35fd","observation_id":"448dfd36-bda8-4f71-b366-2421e9937c5a","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20313","last_updated":"2025-04-03T10:23:19Z","snapshot_observed_at":"2026-08-20T23:09:54.697378Z","submitted_at":"2025-03-26T08:25:12Z","title":"TileLink: Generating Efficient Compute-Communication Overlapping Kernels using Tile-Centric Primitives","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20313","snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"cited_paper":"/paper/2503.20313","citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:a83eef011036dc3b733bb539be1e930a0260deb5c3b5a4d5d167c967e8deb3cf","observation_id":"66733340-790d-4a07-aee5-8eb31c6261aa","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T01:18:48.061500Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-13T01:18:48.061500Z"},"links":{"citing_paper":"/paper/2607.08973"},"observation_digest":"sha256:5e4efed601ac4013b37127948548699f9070691cdc7a46625a91a331ea133199","observation_id":"cb83c275-7ee3-492c-a614-fdac8a9da20d","resolution":{"observed_at":"2026-07-13T01:18:48.061500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08973","last_updated":"2026-07-09T22:34:00Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-19T08:50:52.397407Z","submitted_at":"2026-07-09T22:34:00Z","title":"SiFAR: Synchronization-Free All-Reduce for Low-Latency LLM Inference"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2607.08973."}