{"as_of":"2026-08-08T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:127e0215e5be97697fa18e7b6a1b47e21f738c8782c42d47f28eea1191a1e94d","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:45:07.090558Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:12:55.647909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13277","snapshot_observed_at":"2026-08-03T16:12:55.647909Z","title":"Kazemnejad, A., Padhi, I., Natesan Ramamurthy, K., Das, P., and Reddy, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.14391","last_updated":"2026-06-05T07:13:29Z","snapshot_observed_at":"2026-08-07T22:38:47.386232Z","submitted_at":"2025-12-16T13:30:30Z","title":"RePo: Language Models with Context Re-Positioning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T16:12:55.647909Z"},"links":{"cited_paper":"/paper/2506.13277","citing_paper":"/paper/2512.14391"},"observation_digest":"sha256:4026a022f81ffc5a25b70c5c0efc8fce054ab462b2547bbd82964f8a9595c1e0","observation_id":"6211d7a9-37f4-4ccc-9241-221efd67906d","resolution":{"observed_at":"2026-08-03T16:12:55.647909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13277/citation-record","integrity":"/paper/2506.13277/integrity","json":"/paper/2506.13277/citation-record.json","paper":"/paper/2506.13277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-07T00:45:00.999029Z","title":"The fal- con series of open language models.arXiv preprint arXiv:2311.16867, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:00.999029Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:749f530e2afb10938f4575d4be9d2464c755c49fc8d542310ed6f423beb561a5","observation_id":"b4c26672-508d-466b-8b47-f94579e1d183","resolution":{"observed_at":"2026-08-07T00:45:00.999029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.991991Z","title":"Lex- ical generalization improves with larger models and longer training","venue":null,"work_id":"08bff765-b5d0-477c-9cc9-ad24771b6038","year":2022},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.073755Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:884a788b03124bde02e4ecb90fb40ec1531b24128d4fcdab49fb7e75a115f176","observation_id":"8467c5b6-ca6a-48e7-a2e0-2fc7b15db498","resolution":{"observed_at":"2026-08-07T00:45:14.064162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.851045Z","title":"Language models are few-shot learners.Ad- vances in Neural Information Processing Systems (NeurIPS), 2020","venue":null,"work_id":"711c3fed-36c2-4c33-861d-f6f6a99cc689","year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.152566Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:6e4245a455cf2221d0f32e61925d9104e5d60a587ddff0e74e850df851e9f747","observation_id":"5ee141c4-4d62-4d2a-923a-fd94e56ca50b","resolution":{"observed_at":"2026-08-07T00:45:13.919656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.678997Z","title":"CLEX: Continuous length PREPRINT 10 extrapolation for large language models","venue":null,"work_id":"7d838426-fea6-4435-992c-30ec652aee8b","year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.236848Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:9492af8551fef084aac4d7b2874866fa0944f8bddee46aa8d09f82a328e487b8","observation_id":"537ab71d-2676-46d2-8287-45283bd7d83f","resolution":{"observed_at":"2026-08-07T00:45:13.756266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.550644Z","title":"Neural ordinary differential equations.Advances in Neural Information Processing Systems (NeurIPS), 2018","venue":null,"work_id":"0e900f06-cdda-4564-807c-a3b3b91c66dc","year":2018},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.339596Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:f3279e5932287ad1adc20f316e5c3a6b3b94994c9d80bb47a9799f5914556cf8","observation_id":"3710df3c-d7c6-4470-8fbe-89caadadb9af","resolution":{"observed_at":"2026-08-07T00:45:13.607832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15595","last_updated":"2023-06-28T04:26:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-27T16:26:26Z","title":"Extending Context Window of Large Language Models via Positional Interpolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15595","snapshot_observed_at":"2026-08-07T00:45:01.470351Z","title":"Extending context window of large language models via positional interpolation.arXiv preprint arXiv:2306.15595, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.470351Z"},"links":{"cited_paper":"/paper/2306.15595","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:e95da9dfd8975dae431d13b04418286133b9c677a9c1e9ef7bb5adfb2945295b","observation_id":"a71f24c5-bcb3-49cd-bc7f-8127f681cab5","resolution":{"observed_at":"2026-08-07T00:45:01.470351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:01.567913Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.567913Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:1b575eaf8e6f7c6688ade249161d4115243757fe61c242a9f3733982e1ee64e7","observation_id":"4a0197b4-ceb7-4bf1-97c0-cd9e52646518","resolution":{"observed_at":"2026-08-07T00:45:01.567913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.390018Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":"6aa4131d-84e7-4147-ac76-80498afaf999","year":2019},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.663595Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:39a694a9f3c4593360172640a517c5a85ba3e5ca2060ab906b86c659b46d07fd","observation_id":"e5be5d52-a566-441e-a820-68d0537794f0","resolution":{"observed_at":"2026-08-07T00:45:13.442873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:01.760636Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.760636Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:5df990a595fee59a8717406ca38ca1ded12d1a73a30245991982e10e3b9e81b8","observation_id":"319e795a-8a01-4836-9a0a-88b8d57aff51","resolution":{"observed_at":"2026-08-07T00:45:01.760636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18361","last_updated":"2024-03-28T14:59:44Z","snapshot_observed_at":"2026-07-06T17:51:48.378864Z","submitted_at":"2024-03-27T08:53:13Z","title":"ViTAR: Vision Transformer with Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18361","snapshot_observed_at":"2026-08-07T00:45:01.870482Z","title":"Vitar: Vision transformer with any resolution.arXiv preprint arXiv:2403.18361, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.870482Z"},"links":{"cited_paper":"/paper/2403.18361","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:83dc01d8260bbca30f13f63e31ea5fe7500b2561faab9e8710750caf181faf71","observation_id":"f7e03d8f-84fd-409f-9ca4-ba062b00cb5c","resolution":{"observed_at":"2026-08-07T00:45:01.870482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:13.202761Z","title":"SimCSE: Simple contrastive learning of sentence embeddings","venue":null,"work_id":"95af6765-db99-4cde-a116-42c41b4b73e5","year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:01.947413Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:3e92b6d68da9198b0b79fc4d711b591a1edac378ae0d1a2e6da5ef6434da6d62","observation_id":"dff1153e-1b31-46f5-be67-4af43e4efa2e","resolution":{"observed_at":"2026-08-07T00:45:13.288354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.972261Z","title":"Convolutional sequence to sequence learning","venue":null,"work_id":"1b883081-26d8-4ac5-afb1-6b0c9ad96cc0","year":2017},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.057436Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:d3c5d2c3e91585668e36bb9c132a0be77ddb6bec190c4b10176cbebf0b960255","observation_id":"dab4f1d4-7415-497b-ba99-57b12730a6ac","resolution":{"observed_at":"2026-08-07T00:45:13.059326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.790954Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"710033e9-b834-4257-af1e-78f695204806","year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.138307Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:fd37c395be0f7e96508b1c383ccbd8e1b14aa67b797d5e6a5af1ae00cbd342f6","observation_id":"415ffa9a-92c5-49c8-a3ac-fc93e0f6178a","resolution":{"observed_at":"2026-08-07T00:45:12.866519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.649648Z","title":"Bootstrap your own latent-a new approach to self-supervised learn- ing.Advances in Neural Information Processing Systems (NeurIPS), 2020","venue":null,"work_id":"4decabe9-603b-446c-b78a-ebf9a82da163","year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.246464Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:d0e38e5e5dc8335aa05f09e97a3e9d59ee34004e3a4059e38e7ea4877845b669","observation_id":"a699aa80-0be0-4c0b-ac42-e5b656d60118","resolution":{"observed_at":"2026-08-07T00:45:12.711471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T00:45:02.332038Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.332038Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:f48fb734a2dac4a7c58b95a77361157ab9741fb9ba1ba3481a3d9e23bc20328f","observation_id":"78449ffc-b1b9-47d7-b9ec-ce59d2ec665e","resolution":{"observed_at":"2026-08-07T00:45:02.332038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16634","last_updated":"2022-12-05T22:10:52Z","snapshot_observed_at":"2026-08-07T22:37:16.072384Z","submitted_at":"2022-03-30T19:37:07Z","title":"Transformer Language Models without Positional Encodings Still Learn Positional Information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16634","snapshot_observed_at":"2026-08-07T00:45:02.420065Z","title":"Transformer language models without positional encodings still learn positional information.arXiv preprint arXiv:2203.16634, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.420065Z"},"links":{"cited_paper":"/paper/2203.16634","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:b12288afb4e985780bf32cf882ab0a93321733690e42667715d42c8956f08a64","observation_id":"aaca7eb5-b6f8-4d09-a665-c5d4e9145c51","resolution":{"observed_at":"2026-08-07T00:45:02.420065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:02.529522Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.529522Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:7a4300b71cfafcd6c5346df7a52bb9af0ac318054abc7bcd112d76ca049c9466","observation_id":"b70eba20-f7a4-4880-88c3-c2f6859010e4","resolution":{"observed_at":"2026-08-07T00:45:02.529522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.479359Z","title":"Deberta: Decoding-enhanced bert with disentan- gled attention","venue":null,"work_id":"f1be733c-16d1-4417-837e-af0cd6546507","year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.646691Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:e3c8ac4417699edc1cb7a5b8e14f0818766c8372c360773751a5ba2ccee09d29","observation_id":"1c40ef30-ec7f-4977-9034-52b1f0127379","resolution":{"observed_at":"2026-08-07T00:45:12.565695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.273434Z","title":"Rotary position embedding for vision trans- former","venue":null,"work_id":"53645ce1-2094-4177-9368-38f9d2772b7a","year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.750862Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:385f20baa1d557b59b89c7e7990c2ea497c8a4ef61c7667462f67175d7e63eeb","observation_id":"26d61e26-fd80-4c3f-9725-2bb400f5f1d7","resolution":{"observed_at":"2026-08-07T00:45:12.378153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:12.037502Z","title":"RULER: What’s the real context size of your long- context language models? InFirst Conference on Language Modeling, 2024","venue":null,"work_id":"cf2a30b6-8ef6-4887-8842-f0c0089d2a7e","year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.853715Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:fef8a9375ca95b8e9afe220f80e1e1d056ad0749093f8bc657d1dcff78169629","observation_id":"fe1381c3-5365-42fb-ae49-b9cefe68637a","resolution":{"observed_at":"2026-08-07T00:45:12.168551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17739","last_updated":"2025-07-14T04:23:36Z","snapshot_observed_at":"2026-08-04T11:01:04.622331Z","submitted_at":"2024-12-23T17:44:01Z","title":"Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17739","snapshot_observed_at":"2026-08-07T00:45:02.940894Z","title":"Fourier position embedding: Enhancing attention’s periodic extension for length generalization.arXiv preprint arXiv:2412.17739, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:02.940894Z"},"links":{"cited_paper":"/paper/2412.17739","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:e69065ca0edcc344d28b32b8bc4f8c6db3f68671cc58b75979029f7b913e5cf5","observation_id":"514b9315-dc90-411a-98be-9b81b6177aa4","resolution":{"observed_at":"2026-08-07T00:45:02.940894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13658","last_updated":"2020-09-28T22:18:58Z","snapshot_observed_at":"2026-08-03T17:08:56.864997Z","submitted_at":"2020-09-28T22:18:58Z","title":"Improve Transformer Models with Better Relative Position Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13658","snapshot_observed_at":"2026-08-07T00:45:03.051745Z","title":"Improve transformer models with better relative position embeddings.arXiv preprint arXiv:2009.13658, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.051745Z"},"links":{"cited_paper":"/paper/2009.13658","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:79d9c925524d693db5ac6a1b8d19a0711b502bb06235ae846c7dc0c889a7c261","observation_id":"5ff6ec93-4df7-4e4e-bda9-7843449a3841","resolution":{"observed_at":"2026-08-07T00:45:03.051745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:11.814897Z","title":"Adversarial examples for evaluating reading comprehension systems","venue":null,"work_id":"09652551-43d9-4a72-a2ae-cd1cbf43cbeb","year":2017},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.167771Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:3ccf3d5e1edaa982378a78d648477e1fbfaed6f75dceb2531fc57f8043bc724e","observation_id":"8381f6a9-28ff-495e-a09e-eaf3e6c2ad59","resolution":{"observed_at":"2026-08-07T00:45:11.918224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:11.606708Z","title":"The impact of positional encoding on length generalization in transformers.Advances in Neural Information Process- ing Systems (NeurIPS), 2023","venue":null,"work_id":"10434999-9398-4490-9f49-36f36fc0f189","year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.283782Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:020149a97ced2a1d7b3fee12a3b12b3ce668018cb7d449fa446ef8f421887fbc","observation_id":"0f516603-bfda-4d77-a4bc-534ee05c4830","resolution":{"observed_at":"2026-08-07T00:45:11.704191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:11.419056Z","title":"Rethinking posi- tional encoding in language pre-training","venue":null,"work_id":"2158d468-95f8-44dc-bfb8-388c58ecbdbe","year":null},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.388443Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:6c6f826e9521f1334b4f71b59b47b3f23f8a6238fec5d7f3e4f7793106b0d950","observation_id":"6781791a-f000-40ba-8cca-4568d50cc7dc","resolution":{"observed_at":"2026-08-07T00:45:11.505839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:11.215182Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"0eb5b1b9-c566-46fc-8d25-ae136d8decbf","year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.487818Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:5e88252539df6b8f10c3cf13d97289bfa0b25eba6e9e45fc084f4b59c4ed6de1","observation_id":"fae90996-c431-4a1a-a90f-a2cbc48d2684","resolution":{"observed_at":"2026-08-07T00:45:11.296749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-07T00:45:03.582120Z","title":"Aria: An open multi- modal native mixture-of-experts model.arXiv preprint arXiv:2410.05993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.582120Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:e5538b173cca7fbce2c4f866d3e177aedab4d57fd8dd82865f1d7f2ed9ef613d","observation_id":"03a9cf9c-51af-453e-893c-cbad769da65f","resolution":{"observed_at":"2026-08-07T00:45:03.582120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:11.051755Z","title":"Learning to encode position for transformer with continuous dynamical model","venue":null,"work_id":"8899f459-5130-4fbb-ad48-7d302f0e3d49","year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.790317Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:bdce4b4eb3c4cd560d1dd501b50dbf2d94130006245176f898d19565ce1e941f","observation_id":"ed3925fa-7096-4394-a566-9e20715b40a4","resolution":{"observed_at":"2026-08-07T00:45:11.131311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:10.944979Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"b4c26ba5-a529-42b0-a300-e33c6f320a7a","year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.823094Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:4370ca4f5285bff91fd41e4376c72cb249f404aea319c12f72305f92d42fea6a","observation_id":"3dbe7e5e-5205-4153-adbf-04fac29e2835","resolution":{"observed_at":"2026-08-07T00:45:11.001776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14591","last_updated":"2024-05-23T14:03:31Z","snapshot_observed_at":"2026-08-03T05:12:40.411132Z","submitted_at":"2024-05-23T14:03:31Z","title":"Base of RoPE Bounds Context Length","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14591","snapshot_observed_at":"2026-08-07T00:45:03.934025Z","title":"Base of rope bounds context length.arXiv preprint arXiv:2405.14591, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:03.934025Z"},"links":{"cited_paper":"/paper/2405.14591","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:be2a86beb2eb7ad80e837907a2382720c95f9db7ad06c56ebf5083cdd69e80fa","observation_id":"0c97f88d-dee0-478f-bef3-3f04709645c0","resolution":{"observed_at":"2026-08-07T00:45:03.934025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10322","last_updated":"2025-08-16T06:26:50Z","snapshot_observed_at":"2026-08-04T07:05:14.248415Z","submitted_at":"2024-06-14T17:41:55Z","title":"LieRE: Lie Rotational Positional Encodings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10322","snapshot_observed_at":"2026-08-07T00:45:04.109141Z","title":"Liere: Gen- eralizing rotary position encodings.arXiv preprint arXiv:2406.10322, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.109141Z"},"links":{"cited_paper":"/paper/2406.10322","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:f4e777c7b3d55f2220dbb8de565c6f1445e300dbc8d0a72805c5423fbcf8ee84","observation_id":"3e0a1b9a-3b7e-4bd9-9874-872f0d867ccb","resolution":{"observed_at":"2026-08-07T00:45:04.109141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:04.234158Z","title":"Yarn: Efficient context window extension of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.234158Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:c9d786e1b56624f37ad21ae58248f297ad918277cc010f81d192803af6071630","observation_id":"6f6ff22c-e239-4022-b992-a2981dbb7b05","resolution":{"observed_at":"2026-08-07T00:45:04.234158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:10.820708Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation","venue":null,"work_id":"a61cf039-2685-440e-b13c-aac3a998ccbf","year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.388239Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:46982a2515522f0c134c2d970e8a349a8b5f0c7f5d4f85f195c55b78b5d30758","observation_id":"31ac0734-48c7-40a3-8d86-1ba065ebea8f","resolution":{"observed_at":"2026-08-07T00:45:10.861753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:10.685421Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"844b6d77-f53c-49f9-83bc-e7fc32ef84e9","year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.586652Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:a40974d95116420442022227379b01e61277a5c7022bceb845a385b8c974da5e","observation_id":"618b2fa7-2274-41bb-9b91-3cc8ab016db2","resolution":{"observed_at":"2026-08-07T00:45:10.813472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:04.747048Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.747048Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:9efa6b3b65a57665f66dde867d847a8b27c8fe579f7046b032b5ceb2ae406f0e","observation_id":"d785368e-3271-4ce1-9898-e6e49bebdb97","resolution":{"observed_at":"2026-08-07T00:45:04.747048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:10.484982Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer.Journal of Machine Learning Research, 21:1–67, 2020","venue":null,"work_id":"a3d62d8c-f705-43bd-86db-d54159807a39","year":2020},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:04.944861Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:0d85f5523ab7e2339792850063182faff450f1d0606db1f1f87b4d948b49d769","observation_id":"ece5f877-70fe-4b82-b53c-185d11f4116f","resolution":{"observed_at":"2026-08-07T00:45:10.576725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:09.875706Z","title":"SQuAD: 100,000+ questions for machine comprehension of text","venue":null,"work_id":"6817d261-e9a6-410c-a472-957b06014a96","year":2016},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.042588Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:edfd8bb133e09018ba23793bf028fe1a64ad18b804f6d6b0e92bca2c571b2abe","observation_id":"54926fba-5acf-4e9b-8f2d-d728c182600d","resolution":{"observed_at":"2026-08-07T00:45:10.017690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:09.607168Z","title":"Masked jigsaw puzzle: A versatile position embedding for vision transformers","venue":null,"work_id":"9328e13d-7820-4ddd-8084-ff0ab17246ae","year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.170687Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:11d850da870e464e6b73af38cfb8cac81747513ad2b88a94b9398a2c5f20678a","observation_id":"3d8d4f1f-9a6b-4e1d-b3ae-af838a9b7a02","resolution":{"observed_at":"2026-08-07T00:45:09.735457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:09.343826Z","title":"Randomized positional en- codings boost length generalization of transformers","venue":null,"work_id":"069811ee-d17b-4191-a7fa-4dcaca4b2243","year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.280657Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:f002fdcd04c25024f568eb98f08fd58704805032f7bbafc6e97a1418fff60ac4","observation_id":"d9f8bac7-f1de-4333-aafe-137432d24355","resolution":{"observed_at":"2026-08-07T00:45:09.464603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:09.026860Z","title":"Berg, and Li Fei-Fei","venue":null,"work_id":"a4077320-a3de-41f2-8614-78b825829dcd","year":2015},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.418045Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:aa99ee2c7ba01cb67affc25842b9052fcbba136ddde0ab7145b846f8abcd96e8","observation_id":"045a7d73-d0ed-43f1-a9db-58dc3ac37653","resolution":{"observed_at":"2026-08-07T00:45:09.185234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02155","last_updated":"2018-04-12T18:51:33Z","snapshot_observed_at":"2026-07-06T06:26:51.386842Z","submitted_at":"2018-03-06T13:13:11Z","title":"Self-Attention with Relative Position Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02155","snapshot_observed_at":"2026-08-07T00:45:05.524625Z","title":"Self- attention with relative position representations.arXiv preprint arXiv:1803.02155, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.524625Z"},"links":{"cited_paper":"/paper/1803.02155","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:c672354b6e71b3cec8f8069d0d6c7ec3ee6b1f6409cf3bc7b7a553a0f4114658","observation_id":"6d364f78-d86f-4995-81a8-df0a26af711c","resolution":{"observed_at":"2026-08-07T00:45:05.524625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:05.645116Z","title":"Roformer: Enhanced trans- former with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.645116Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:88d1c0f737419ce15df2205986f5a4c61a9527cd94230a330b068eecbd3ce236","observation_id":"1016d1e4-8d87-4f21-927a-2189a1ce1e0f","resolution":{"observed_at":"2026-08-07T00:45:05.645116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:08.714119Z","title":"Training data-efficient image transformers & distillation through attention","venue":null,"work_id":"0b1088a7-6a7c-4cb5-a3a9-f318a1e5ca5a","year":2021},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.773002Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:4138dbda6fab9c8687c1bef7c0086a0d0ee406228dca081215ae41714ac95500","observation_id":"af7abcf0-206d-45a5-a182-ebc0c74839e3","resolution":{"observed_at":"2026-08-07T00:45:08.880167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:45:05.930536Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:05.930536Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:d5d2727be827848e07fec065a68ee5fcd83fcfd4fd5fa96e38a82a9cff0fb48c","observation_id":"c7c6735d-94d0-4490-a28d-066974923268","resolution":{"observed_at":"2026-08-07T00:45:05.930536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:08.384340Z","title":"Neural discrete representation learning.Advances in Neural Information Processing Systems (NeurIPS), 2017","venue":null,"work_id":"1b180954-9d8d-4c1d-a605-7ddd1b5ce5af","year":2017},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.031459Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:462b3a05a4233ef16012b0d6289c927812aa73b1a78bdd9c664fe09b8da27c8a","observation_id":"f24ebe96-1486-4ad4-961c-929e2fc71cf3","resolution":{"observed_at":"2026-08-07T00:45:08.549619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:08.137446Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"64d4e4bc-4d95-461d-952f-33ccfea27df1","year":2017},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.140369Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:0c30487d240d927e85e26d592b3634985f183850d9d6717df31bbbd93fa982e0","observation_id":"34acc6fe-9ffc-49cd-9af3-ceb4b8532718","resolution":{"observed_at":"2026-08-07T00:45:08.262950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:07.903132Z","title":"Encoding word order in complex embeddings","venue":null,"work_id":"bbbca4e5-0568-4eb6-96c3-5d998c332b36","year":2019},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.279460Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:4d7624b5887a5e3e1962c8b30d3497cfa1661ba02a6de5940888f7f949988d99","observation_id":"53af0900-39fc-4d9a-8388-3e07b958318c","resolution":{"observed_at":"2026-08-07T00:45:08.017345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08651","last_updated":"2025-05-13T15:13:15Z","snapshot_observed_at":"2026-08-07T15:45:43.145732Z","submitted_at":"2025-05-13T15:13:15Z","title":"Scaling Context, Not Parameters: Training a Compact 7B Language Model for Efficient Long-Context Processing","version":1},"cited_work":{"arxiv_id":"2505.08651","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.08651","snapshot_observed_at":"2026-08-07T00:45:07.351527Z","title":"Scaling Context, Not Parameters: Training a Compact 7B Language Model for Efficient Long-Context Processing","venue":"cs.CL","work_id":"ad31c320-0505-42d9-a79c-4fc30f38c49e","year":2025},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.385103Z"},"links":{"cited_paper":"/paper/2505.08651","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:c446b49909efec8a9f8132b12de04b922743930491705fe7ed1a6fe8cb5f4942","observation_id":"18b3d858-4843-4de1-9cf0-4ddb4cf95d73","resolution":{"observed_at":"2026-08-07T00:45:07.462889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T00:45:06.470613Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.470613Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:22de93a5eff45da29a1d576261d09a0cbbf20a9deab6cd59bd29132003ca41a2","observation_id":"49a27808-1168-4832-85ae-db7ec72b3a0c","resolution":{"observed_at":"2026-08-07T00:45:06.470613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:06.595748Z","title":"Rope to nope and back again: A new hybrid attention strategy.arXiv preprint arXiv:2501.18795, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.595748Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:92268e531132d414a9327b95c652af99d4ee23a1830b2d9626af63caa273163d","observation_id":"5f45b07c-543d-4761-885f-d12285e3c759","resolution":{"observed_at":"2026-08-07T00:45:06.595748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17044","last_updated":"2024-10-06T08:37:05Z","snapshot_observed_at":"2026-08-04T22:47:59.665023Z","submitted_at":"2023-12-28T14:42:24Z","title":"Length Extrapolation of Transformers: A Survey from the Perspective of Positional Encoding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17044","snapshot_observed_at":"2026-08-07T00:45:06.736553Z","title":"Length extrapolation of transformers: A survey from the perspective of position encoding.arXiv preprint arXiv:2312.17044, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.736553Z"},"links":{"cited_paper":"/paper/2312.17044","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:8376fbb6315b8ad144f7c06c80f94f63c31bcc66e7ff62087f0e3c7ac7b0fc4a","observation_id":"a83ecd89-2525-47a1-9369-02773535c69e","resolution":{"observed_at":"2026-08-07T00:45:06.736553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:45:07.708261Z","title":"Gonzalez, Clark Bar- rett, and Ying Sheng","venue":null,"work_id":"bed8ff7e-2230-4050-bbe7-ad2465f32ec5","year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.846084Z"},"links":{"citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:c7576bfb500b262796705829bd6c52684ac70798a2fc21920792cdd522ec48d4","observation_id":"977641ad-e15a-4f3a-bd4f-61d87cf7fd34","resolution":{"observed_at":"2026-08-07T00:45:07.786520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-07T00:45:06.966912Z","title":"Trans- fusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:06.966912Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:2f215e645d5f2d480f33436e1e1f84c0eb8c4a1e4e020a01c0bbd75683b98ffa","observation_id":"d8c591f1-df36-4c79-9e62-5873c2e52e81","resolution":{"observed_at":"2026-08-07T00:45:06.966912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10400","last_updated":"2024-02-21T13:37:07Z","snapshot_observed_at":"2026-08-02T07:16:04.509348Z","submitted_at":"2023-09-19T08:03:38Z","title":"PoSE: Efficient Context Window Extension of LLMs via Positional Skip-wise Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10400","snapshot_observed_at":"2026-08-07T00:45:07.090558Z","title":"2”, . . . , s0 k =“3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:07.090558Z"},"links":{"cited_paper":"/paper/2309.10400","citing_paper":"/paper/2506.13277"},"observation_digest":"sha256:3b73cfa3da1b6f073a7d138efb4f904b64e719ef4730796b0fdf66a873b7e03c","observation_id":"72172605-5ec6-4225-9f6a-e932e8fca891","resolution":{"observed_at":"2026-08-07T00:45:07.090558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13277","last_updated":"2025-06-17T10:12:39Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T00:34:20.823418Z","submitted_at":"2025-06-16T09:16:40Z","title":"SeqPE: Transformer with Sequential Position Encoding"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2506.13277."}