Letta AI · Bộ nhớ / 16/8/2026
Xây dựng bộ nhớ dài hạn thông minh với Letta AI và n8n
Kiến trúc thực tế để trợ lý n8n có bộ nhớ bền vững với Letta AI.
Read English version →Đây là hướng dẫn Letta AI và n8n được biên tập lại theo dạng ghi chép workshop TICMIRO, giữ rõ từng chặng của workflow.
Xây “bộ não vàng”: tích hợp bộ nhớ dài hạn Letta AI vào n8n
Chào mọi người, Ticmiro đây.
Một trong các khó khăn lớn khi xây trợ lý ảo hoặc chatbot tự động trên n8n là trạng thái. n8n xử lý tác vụ không trạng thái rất tốt: nhận yêu cầu, xử lý rồi kết thúc. Nhưng làm sao để trợ lý nhớ điều bạn đã nói ở lượt trước, thậm chí từ tuần trước?
Sau nhiều lần thử và tinh chỉnh, tôi đã xây dựng một kiến trúc ổn định để biến n8n từ công cụ tự động hóa thành nền tảng tạo AI agent có trí nhớ thật. Bộ nhớ này có thể dần tích lũy ngữ cảnh, phong cách trao đổi và mức độ hiểu người dùng theo thời gian.
Mô hình kiến trúc “vòng lặp bộ nhớ”
Để AI có thể “nhớ”, cần tạo vòng lặp: thông tin mới được lưu lại và thông tin cũ được gọi ra đúng lúc. Kiến trúc gồm ba thành phần.
- n8n (điều phối): nhận yêu cầu, quyết định luồng xử lý và gọi các dịch vụ.
- Letta AI trên VPS (bộ nhớ dài hạn): lưu tương tác của người dùng và AI vào PostgreSQL có pgvector, đồng bộ cùng hệ RAG.
- LLM (bộ máy suy luận): nhận ngữ cảnh, gồm cả ký ức Letta trả về, để tạo phản hồi phù hợp.
Tích hợp Letta AI vào n8n
Luồng tối ưu là: Webhook → Lưu và gọi lại bộ nhớ → Chuẩn bị ngữ cảnh → Gọi LLM → Lưu phản hồi AI → Trả kết quả. Cách này giảm node không cần thiết và giữ thời gian phản hồi ổn định.
Bước 1: chuẩn bị
Hãy có hạ tầng Letta AI chạy trên VPS, URL API (ví dụ http://YOUR_VPS_IP:8283) và API key. Không đưa key vào workflow tĩnh; lưu trong biến môi trường hoặc credential store của n8n.
Bước 2: nhận tin nhắn và cập nhật bộ nhớ
Webhook nhận sessionId và chatInput. Một HTTP Request gửi tin nhắn mới tới /v1/agents/{sessionId}/messages bằng Bearer token. Node này vừa ghi nhận tin nhắn, vừa trả về lịch sử đã cập nhật để workflow dùng ở bước tiếp theo.
Bước 3: chuẩn bị ngữ cảnh
Dùng Code node để lấy các tin nhắn gần nhất, giới hạn độ dài lịch sử nhằm giữ prompt gọn và chi phí dễ kiểm soát. Chỉ đưa phần ngữ cảnh cần thiết vào prompt của AI Agent.
Bước 4: trả lời và lưu phản hồi
AI Agent tạo câu trả lời từ lịch sử hội thoại và câu hỏi mới nhất. Sau đó một HTTP Request khác ghi phản hồi với vai trò assistant vào cùng agent Letta trước khi trả kết quả cho người dùng.
Kết quả: trợ lý không quên
Khi kết hợp các node này, trợ lý có thể nhớ tên, công việc đang dang dở và nội dung đã trao đổi trước đó. Giá trị thực không nằm ở việc “nhớ mọi thứ”, mà ở việc tách phần bộ nhớ khỏi phần suy luận, sau đó kết nối hai phần bằng một luồng có kiểm soát.
Ghi chú workshop: giữ credential trong biến môi trường, áp dụng quyền tối thiểu và thử toàn bộ workflow trên môi trường không phải production trước.