Triển khai các tác nhân cục bộ ở mọi nơi với LFM2.5-2.6B
Giới thiệu LFM2.5-2.6B, cho phép triển khai các tác nhân cục bộ trên nhiều nền tảng khác nhau một cách dễ dàng và hiệu quả.
- 7 min read
Triển khai tác tử cục bộ ở mọi nơi với LFM2.5-2.6B
LFM2.5-2.6B được thiết kế để vận hành các tác tử (agents) mạnh mẽ hoàn toàn trực tiếp trên thiết bị (on-device). Mô hình hỗ trợ gọi công cụ (tool calling) và các quy trình làm việc nhiều bước, đồng thời giữ được kích thước nhỏ gọn và tốc độ đủ nhanh cho các phần cứng thông thường, từ máy tính xách tay đến điện thoại. Điều này cho phép các nhà phát triển triển khai tác tử ở mọi nơi, giữ cho dữ liệu riêng tư ngay trên thiết bị và mở rộng quy mô sử dụng mà không tốn chi phí điện toán đám mây.
- Tác tử tốt nhất trong phân khúc: Cạnh tranh sòng phẳng với các mô hình lớn hơn gấp 4 lần về khả năng sử dụng công cụ, tuân thủ hướng dẫn và các tác vụ tác tử nhiều bước.
- Học tăng cường tác tử (Agentic Reinforcement Learning): Được huấn luyện bên trong các môi trường (harnesses) tác tử phổ biến nhất để cải thiện độ tương thích.
- Suy luận hiệu quả: Đạt 220 token/giây trên Apple M5 Max và 113 token/giây trên CPU AMD Ryzen, sử dụng dưới 2,5 GB bộ nhớ.
Cách chúng tôi xây dựng mô hình tác tử đáng tin cậy cho thiết bị biên
LFM2.5-2.6B được huấn luyện trước trên khoảng 34 nghìn tỷ (34T) token, với giai đoạn huấn luyện trung gian mở rộng cửa sổ ngữ cảnh lên 128K. Sau đó, quá trình hậu huấn luyện biến mô hình cơ sở thành một tác tử qua bốn giai đoạn:
- Tinh chỉnh có giám sát (SFT): Hai vòng SFT, tập trung mạnh vào dữ liệu tác tử như sử dụng công cụ, tìm kiếm web và quỹ đạo hành vi (trajectories).
- Chuyên môn hóa giáo viên (Teacher specialization): Huấn luyện một mô hình giáo viên chuyên sâu cho từng lĩnh vực (toán học, lập trình, sử dụng công cụ, v.v.).
- Chưng cất đồng chính sách đa lĩnh vực (MOPD): Chưng cất các mô hình giáo viên chuyên gia thành một học viên duy nhất.
- Học tăng cường tác tử (Agentic RL): Chạy RL nhiều lượt bên trong các môi trường tác tử thực tế, nơi mô hình học cách làm việc với các công cụ, câu lệnh hệ thống (system prompts) và môi trường tác vụ đa lượt khác nhau.
Quy trình Học tăng cường tác tử tách biệt việc tối ưu hóa mô hình, suy luận và thực thi môi trường thành các thành phần riêng biệt. Công cụ Huấn luyện (Training Engine) tối ưu hóa mô hình, trong khi Công cụ Triển khai (Rollout Engine) tạo ra các hành động sử dụng chính sách mới nhất. Khung RL (RL framework) điều phối vòng lặp huấn luyện bằng cách khởi chạy các lượt chạy, thu thập quỹ đạo cùng phần thưởng, và cập nhật mô hình.
Các hành động được thực thi trong một Dịch vụ Hộp cát (Sandbox Service), nơi Hành trang Hộp đen (Blackbox Harness) lưu trữ tác tử (ví dụ: OpenClaw hoặc Hermes Agent) và phối hợp tương tác với môi trường tác vụ. Trình ủy quyền Harness (Harness Proxy) cho phép chúng ta xử lý các môi trường tác tử như những hộp đen mà không cần sửa đổi, đồng thời thu thập một cách minh bạch các quỹ đạo cấp token cần thiết để tái tạo và xác thực các mẫu huấn luyện RL.
Kết quả đánh giá chuẩn (Benchmark)
Chúng tôi đã đánh giá LFM2.5-2.6B so với các mô hình có kích thước lớn hơn tới ~4 lần trên các lĩnh vực STEM, tuân thủ hướng dẫn, sử dụng công cụ và các tác vụ tác tử. Đây là mô hình nhỏ nhất trong nhóm nhưng lại cạnh tranh và thường vượt qua các đối thủ khác.
| Benchmark | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AA Omniscience | -29.50 | -74.47 | -49.03 | -54.30 | -50.43 |
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBenchv6 | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandbox | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| τ³-Bench Banking | 5.67 | 3.35 | 4.12 | 5.45 | 5.15 |
| Claw-Eval average (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| PinchBench | 68.22 | 44.24 | 55.09 | 71.26 | 71.45 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
Thế mạnh của mô hình đối với ứng dụng của bạn là khả năng tuân thủ hướng dẫn và sử dụng công cụ. LFM2.5-2.6B đứng đầu mọi bài kiểm tra chuẩn về tuân thủ hướng dẫn và mọi bài kiểm tra sử dụng công cụ (ngoại trừ BFCLv4, nơi chỉ có Qwen 9.7B vượt lên trước một chút). Về các tác vụ tác tử, mô hình đánh bại cả hai mẫu Gemma và giữ thế cân bằng với các mẫu Qwen. Mô hình này cũng dẫn đầu về kiến thức và bám sát về toán học. Lập trình là lĩnh vực duy nhất mà các mô hình lớn hơn vẫn duy trì lợi thế rõ rệt, vì vậy hãy chọn mô hình lớn hơn nếu bạn cần giải quyết các bài toán lập trình phức tạp.
Tốc độ suy luận trên CPU và GPU
LFM2.5-2.6B hỗ trợ ngay từ ngày đầu tiên trên toàn bộ hệ sinh thái suy luận, bao gồm llama.cpp, MLX, vLLM, SGLang và ONNX.
Suy luận trên CPU. Nhờ kiến trúc LFM2 hiệu quả, LFM2.5-2.6B là mô hình nhanh nhất mà chúng tôi đã thử nghiệm, với tốc độ giải mã đạt 220 token/giây trên M5 Max và 113 token/giây trên Ryzen AI Max+ 395. Với tốc độ 30 token/giây, mô hình cho phép bạn chạy các tác tử mạnh mẽ ngay trên điện thoại.
Suy luận trên GPU. LFM2.5-2.6B là mô hình nhanh nhất trong cùng phân khúc kích thước, đạt gần 15.000 token đầu ra mỗi giây ở mức độ đồng thời cao, tương đương khoảng 1,3 tỷ token mỗi ngày trên một thẻ H100 đơn.
Cách sử dụng LFM2.5-2.6B
Hãy lựa chọn LFM2.5-2.6B khi bạn cần các tác tử chạy trên thiết bị cho khối lượng công việc lớn.
Cài đặt phiên bản mới nhất của thư viện transformers (tương thích với transformers>=5.0.0):
pip install -U transformers
Sau đó tải và chạy mô hình:
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "LiquidAI/LFM2.5-2.6B"
model = AutoModelForCausalLM.from_pretrained(
model_id,
device_map="auto",
dtype="bfloat16",
# attn_implementation="flash_attention_2" # bỏ ghi chú nếu dùng GPU tương thích
)
tokenizer = AutoTokenizer.from_pretrained(model_id)
prompt = "What is C. elegans?"
input_ids = tokenizer.apply_chat_template(
[{"role": "user", "content": prompt}],
add_generation_prompt=True,
return_tensors="pt",
tokenize=True,
).to(model.device)
output = model.generate(
input_ids,
do_sample=True,
temperature=0.2,
top_k=80,
repetition_penalty=1.05,
max_new_tokens=512,
)
print(tokenizer.decode(output[0], skip_special_tokens=False))
Bản demo LFM2.5-2.6B
Hãy xem bản demo trình duyệt của LFM2.5-2.6B vận hành một tác tử nghiên cứu. Tác tử này giúp bạn nghiên cứu các câu hỏi cụ thể và tạo ra một bản tóm tắt.
Bắt đầu
Cả LFM2.5-2.6B và LFM2.5-2.6B-Base hiện đã có mặt trên Hugging Face.
Với LFM2.5, chúng tôi đang hiện thực hóa tầm nhìn về AI có thể chạy ở bất cứ đâu. Các mô hình này bao gồm:
- Tải xuống: LFM2.5-2.6B-Base và LFM2.5-2.6B trên Hugging Face.
- Trải nghiệm: Chạy bản demo WebGPU trực tiếp trong trình duyệt của bạn mà không cần cài đặt gì thêm.
- Sử dụng trong môi trường của bạn: Làm theo hướng dẫn của chúng tôi về cách chạy một tác tử cục bộ, chẳng hạn như OpenClaw, Hermes Agent và Pi.
Chúng tôi rất nóng lòng muốn xem những gì bạn sẽ xây dựng.
Trích dẫn
Vui lòng trích dẫn bài viết này như sau:
Liquid AI, "LFM2.5-2.6B: Deploy Agents Everywhere", Liquid AI Blog, Aug 2026.
Hoặc sử dụng định dạng trích dẫn BibTeX:
@article{liquidAI202626B,
author = {Liquid AI},
title = {LFM2.5-2.6B: Deploy Agents Everywhere},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-2-6b},
}
Link bài viết gốc
- Tags:
- Ai
- August 4, 2026
- Huggingface.co




