{"as_of":"2026-08-17T20:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a72b4f7f48c6228fb88862b95877280513ffc2225e4d7e5c4741d619a56a029","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:54:46.812096Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-08T09:45:57.201837Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:16:10.526836Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"cited_work":{"arxiv_id":"2505.02533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02533","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c54de77-56a8-478a-b803-33ea87d5963d","year":2025},"citing_paper":{"arxiv_id":"2604.22906","last_updated":"2026-04-24T16:56:53Z","snapshot_observed_at":"2026-08-13T00:03:50.004075Z","submitted_at":"2026-04-24T16:56:53Z","title":"Network Edge Inference for Large Language Models: Principles, Techniques, and Opportunities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-08T09:45:57.201837Z"},"links":{"cited_paper":"/paper/2505.02533","citing_paper":"/paper/2604.22906"},"observation_digest":"sha256:3d5afe26e27a741bb4c046748367a878cdfb6fca7f94a9a537b7887885c86c49","observation_id":"16d738a7-7593-408d-b3bb-463e39467121","resolution":{"observed_at":"2026-05-11T20:16:10.529259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.02533/citation-record","integrity":"/paper/2505.02533/integrity","json":"/paper/2505.02533/citation-record.json","paper":"/paper/2505.02533"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.14371","last_updated":"2024-05-23T09:46:22Z","snapshot_observed_at":"2026-08-16T13:50:17.346787Z","submitted_at":"2024-05-23T09:46:22Z","title":"EdgeShard: Efficient LLM Inference via Collaborative Edge Computing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14371","snapshot_observed_at":"2026-08-16T00:54:46.730815Z","title":"Edgeshard: Efficient llm inference via collaborative edge computing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.730815Z"},"links":{"cited_paper":"/paper/2405.14371","citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:32138dfad82d53447614f15f5006bc16a82b182e5062d6835f8008279802890f","observation_id":"6a272bea-1e7c-4b8e-bc43-2cb9a607dc3e","resolution":{"observed_at":"2026-08-16T00:54:46.730815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10759","last_updated":"2024-10-16T16:31:37Z","snapshot_observed_at":"2026-08-16T13:09:30.499526Z","submitted_at":"2024-10-14T17:38:41Z","title":"SplitLLM: Collaborative Inference of LLMs for Model Placement and Throughput Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10759","snapshot_observed_at":"2026-08-16T00:54:46.736406Z","title":"Splitllm: Collaborative infer- ence of llms for model placement and throughput optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.736406Z"},"links":{"cited_paper":"/paper/2410.10759","citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:8956c0c4552888fe120976b85d89df6900ddec69ba1fd2c31c7139cc0405e17f","observation_id":"cf602b55-b084-4bb5-8deb-4cd5c7136544","resolution":{"observed_at":"2026-08-16T00:54:46.736406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.110351Z","title":"Galaxy: A resource-efficient collaborative edge ai system for in-situ transformer inference,","venue":null,"work_id":"4ceda5b6-07c5-4a8d-a61c-a5c6c153c757","year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.741716Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:609092862a27126a1516a017a46532473b84e3984fe59aae2fd4fe68a61b1978","observation_id":"0a82c498-8154-4fba-85de-ccc1754349e3","resolution":{"observed_at":"2026-08-16T00:54:47.114469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.098020Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":"e42c0285-5909-4dca-834f-1028d051b15a","year":1901},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.746247Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:91760491df8a18e032131a3ecc4072293606d242f537bc2b305434ee6fb49108","observation_id":"ac62089e-ffc0-4aed-a02c-a83caae85127","resolution":{"observed_at":"2026-08-16T00:54:47.102495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.084073Z","title":"6g technology overview,","venue":null,"work_id":"b05214cd-080e-4111-91f9-043bfb0469ab","year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.752903Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:9e78808d98796c86b7aaaa27d5fbd0e8991d7b7757e3d4b448348c5a9b76a83a","observation_id":"e0edf7a8-d28a-45ea-93bb-41b95800e1f1","resolution":{"observed_at":"2026-08-16T00:54:47.088538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.071894Z","title":"Dnn partitioning and inference task offloading in 6g resource-constrained networks,","venue":null,"work_id":"abab1c3c-2805-4228-ba5f-5b163a469226","year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.756877Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:6a9ae44abd0f1f5025de6e25dfd396a4f52f27da1f5d6e143d7ad64cb110e3ac","observation_id":"5256ce74-4766-410f-b1c0-838730c2dac3","resolution":{"observed_at":"2026-08-16T00:54:47.076062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.058628Z","title":"Splitplace: Ai augmented splitting and placement of large-scale neural networks in mobile edge environments,","venue":null,"work_id":"c8ccb86a-546d-4cce-b933-bd0177578ac0","year":2023},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.760997Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:e4179fb3058895962bb75f105611833ad6a0b8560339a1d1b54d7ded97926b30","observation_id":"f2541d85-f014-479b-a75f-e832e283a9e8","resolution":{"observed_at":"2026-08-16T00:54:47.063083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.044690Z","title":"Joint optimization of the partition and scheduling of dnn tasks in computing and network convergence,","venue":null,"work_id":"90544588-355e-43ec-9395-f1e41c7784f2","year":2023},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.765023Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:9019cb465f6585f1b0bbbaa9ea98df1e98dd1ee235b35544450cc03f44dfb590","observation_id":"769c876a-f3ff-4c81-92c2-2d9ea2300583","resolution":{"observed_at":"2026-08-16T00:54:47.049461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.029710Z","title":"Joint optimization of dnn partition and continuous task scheduling for digital twin-aided mec network with deep reinforcement learning,","venue":null,"work_id":"687cab63-541e-4cf5-aacd-484596c96657","year":2023},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.768989Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:613174d3157627a9aead83e47d15af1392ff9289da1e51ecd1f365f2defc45ea","observation_id":"3f934288-8d4d-40db-a7c1-b8df6506c1fe","resolution":{"observed_at":"2026-08-16T00:54:47.035460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.772434Z","title":"Huang, Y","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.772434Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:f3496a37de8eb22e2e3460cd0138af9d0475c9dd77e81899a285452d2601d8bf","observation_id":"64a78c78-37e5-43fc-9dde-006eb77ebf0c","resolution":{"observed_at":"2026-08-16T00:54:46.772434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:47.006345Z","title":"Pipedream: generalized pipeline parallelism for dnn training,","venue":null,"work_id":"68c55a72-f3de-481c-8853-fca8dbbaa87b","year":2019},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.776387Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:23d1df4fddc859a7efa6e41b19a24e6a974f164162cd0246f848c95fab707455","observation_id":"3391209d-cded-4304-821b-27f1cd320ebd","resolution":{"observed_at":"2026-08-16T00:54:47.011289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.964120Z","title":"Autopipe: A fast pipeline parallelism approach with balanced partitioning and micro- batch slicing,","venue":null,"work_id":"10831875-0a34-4ee6-819c-860abbebc009","year":2022},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.780076Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:9aa6f561bc6557891a804bfa63ef5721b9d74f427efe6f727aad0fc729146e20","observation_id":"c0667170-2416-4641-b0ab-8d515958be94","resolution":{"observed_at":"2026-08-16T00:54:46.977365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.934521Z","title":"Memory-efficient pipeline-parallel dnn training,","venue":null,"work_id":"2eff322a-a7da-4193-a348-ec55247bb733","year":2021},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.784317Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:245055da05f107fee4519a5f5b207a80cf35e72b3042d4171113b3a595064e78","observation_id":"d2f0ab22-8510-4a26-92a6-ec7f821d95c9","resolution":{"observed_at":"2026-08-16T00:54:46.946864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.906172Z","title":"3d parallelism for transformers via integer programming,","venue":null,"work_id":"b1edc4bd-e09a-4c60-9c9c-fbec24f94ac4","year":2024},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.788881Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:9881fbd03a0551374a8c25b3c98fd609d45c228dea4f444823a3563d5dc29dcc","observation_id":"1d614240-fd22-4cae-a086-59489a1db3b5","resolution":{"observed_at":"2026-08-16T00:54:46.916654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.893600Z","title":"Distributed Transformer Inference Simulator","venue":null,"work_id":"08ea3878-1836-4251-b810-009ee26d18f1","year":2025},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.800786Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:8b58f25c98fbeec424b4a0b6272d2acb23e87071ae27325de9f52c20efce67d8","observation_id":"457e8af3-24fa-402b-b136-fa2a9b3e526d","resolution":{"observed_at":"2026-08-16T00:54:46.897800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.877480Z","title":"Google cluster-usage traces: format+ schema,","venue":null,"work_id":"8f47714c-9970-46c9-92d0-687cbc04d806","year":2012},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.808123Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:798ead2578978878365df383b6e574c06cdbbe42eaf7dc17527ea492a553e1f3","observation_id":"f32dd22c-79ea-43f2-8aaf-30b4c766e4cc","resolution":{"observed_at":"2026-08-16T00:54:46.883972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:54:46.812096Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:54:46.812096Z"},"links":{"citing_paper":"/paper/2505.02533"},"observation_digest":"sha256:db7b1f70f091103ddc9aa8b235dd596c33e5885709cce52b9847c1ade4a3389e","observation_id":"4c9939d6-f98b-4cfa-831d-019d7571081a","resolution":{"observed_at":"2026-08-16T00:54:46.812096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.02533","last_updated":"2025-05-05T10:16:16Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T12:12:19.128951Z","submitted_at":"2025-05-05T10:16:16Z","title":"Large Language Model Partitioning for Low-Latency Inference at the Edge"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2505.02533."}