Tri thức & Tin tức

Khám phá Công nghệ
& Sáng tạo

Nơi chia sẻ những nghiên cứu mới nhất, kinh nghiệm kỹ thuật và các tin tức sự kiện từ cộng đồng SIU AI Lab.

Sinh viên SIU tham gia Hội nghị Quốc tế SOICT 2025 tại Nha Trang
Conference
19 - 12 - 2025 Tin mới nhất

Sinh viên SIU tham gia Hội nghị Quốc tế SOICT 2025 tại Nha Trang

Trong tháng 12/2025, sinh viên Trường Đại học Quốc tế Sài Gòn (SIU) đã tham gia và trình bày các công trình nghiên cứu tại SOICT 2025 – The 14th International Symposium on Information and Communication Technology, hội nghị khoa học quốc tế uy tín trong lĩnh vực Công nghệ Thông tin và Truyền thông, được tổ chức tại thành phố Nha Trang.

Tất cả bài viết

Xây AI Agent đầu tiên với OpenAI Agents SDK
AI 17 - 08 - 2026

Xây AI Agent đầu tiên với OpenAI Agents SDK

Một mô hình ngôn ngữ có thể tạo ra câu trả lời rất thuyết phục, nhưng điều đó chưa đủ để biến nó thành một AI Agent. Điểm khác biệt xuất hiện khi mô hình có thể sử dụng công cụ, nhận kết quả từ công cụ và tiếp tục thực hiện nhiệm vụ dựa trên những kết quả đó. from agents import Agent agent = Agent(     instructions="You are a smart farm assistant. ", Đoạn code trên chưa tạo ra một “siêu AI” mới. Nó chỉ định nghĩa cách Agent được sử dụng và nhiệm vụ mà nó phải thực hiện.

JEPA: Bản thiết kế của Meta cho những cỗ máy biết "hiểu" thế giới
JEPA 08 - 08 - 2026

JEPA: Bản thiết kế của Meta cho những cỗ máy biết "hiểu" thế giới

AI tạo sinh đang khiến cả thế giới trầm trồ — chatbot trò chuyện mượt như người thật, ảnh chân thực dựng lên chỉ từ vài dòng chữ, code tự viết chính mình. Nhưng nếu nhìn kỹ hơn một chút, phần lớn các mô hình này vẫn đang làm một việc rất "thợ": đoán từ tiếp theo, đoán pixel tiếp theo, mà chưa chắc đã thực sự "hiểu" cái mình đang tạo ra. Yann LeCun, Giám đốc Khoa học AI của Meta, đã nhắc đi nhắc lại suốt nhiều năm rằng: muốn máy móc thông minh thật sự, chúng cần học cách dự đoán trong không gian biểu diễn (representation space), chứ không phải dự đoán trực tiếp trên dữ liệu thô. Ý tưởng đó giờ đã có tên gọi chính thức: JEPA — Joint Embedding Predictive Architecture. Bài viết này sẽ giải thích JEPA là gì, vì sao nó đi ngược lại lối mòn cũ, và vì sao nó có thể là mảnh ghép quan trọng cho thế hệ AI tiếp theo. 2. Ý tưởng lõi: dự đoán biểu diễn, không dự đoán pixelJEPA không phải một mô hình cụ thể, mà là một bản thiết kế để xây các hệ thống học tự giám sát. Ba mảnh ghép chính:    • Bộ mã hóa ngữ cảnh — chỉ nhìn thấy một phần của thế giới (ví dụ: các mảng ảnh chưa bị che).     • Bộ mã hóa mục tiêu — nhìn thấy toàn bộ quan sát gốc (hoặc một góc nhìn khác của cùng cảnh đó).     • Bộ dự đoán — lấy biểu diễn từ bộ mã hóa ngữ cảnh, cộng với gợi ý về vị trí/thời điểm cần đoán, rồi cố đoán ra biểu diễn mà bộ mã hóa mục tiêu sẽ tạo ra cho phần bị ẩn. Điểm then chốt nằm ở chỗ: hàm mất mát được tính giữa đầu ra của bộ dự đoán và biểu diễn mục tiêu — một vector tiềm ẩn, chứ không phải pixel thật. Không có bước "vẽ lại" nào cả. Nhờ vậy mô hình buộc phải bỏ qua nhiễu ở mức pixel và tập trung vào bản chất ngữ nghĩa của phần bị thiếu. Ví dụ dễ hình dung: nếu một mô hình tạo sinh phải đoán một mảng trời bị che, nó sẽ cố vẽ ra những đám mây trông hợp lý. JEPA thì khác — nó chỉ cần đoán ra đặc trưng trừu tượng khiến mảng đó "giống bầu trời": tông màu, loại kết cấu, vai trò trong bố cục — mà chẳng quan tâm từng pixel xếp ở đâu. Kết quả là một biểu diễn gọn hơn, hiệu quả hơn, và dễ tái sử dụng cho các tác vụ khác. Sơ đồ dưới đây tóm tắt luồng hoạt động này: 4. I-JEPA: nhìn ra bức tranh lớn mà không cần từng pixelI-JEPA, ra mắt năm 2023, áp dụng công thức trên vào hình ảnh. Mô hình dùng nền tảng Vision Transformer (ViT): phần lớn ảnh (khoảng 70–80% số mảng) bị che ngẫu nhiên, chỉ chừa lại vài khối làm ngữ cảnh. Bộ mã hóa ngữ cảnh chỉ xử lý những mảng còn nhìn thấy. Bộ mã hóa mục tiêu xử lý cùng bức ảnh đó, nhưng chỉ lấy biểu diễn ở đúng những mảng bị che. Bộ dự đoán sau đó nhận đầu ra của bộ mã hóa ngữ cảnh cùng các token đánh dấu vị trí mục tiêu, và phải đoán ra biểu diễn tương ứng. Điều đáng chú ý không chỉ là I-JEPA hoạt động tốt, mà nó làm được điều đó với ít tài nguyên hơn hẳn. Trên ImageNet, khi đóng băng phần thân mô hình và chỉ huấn luyện một lớp phân loại tuyến tính (linear probing), I-JEPA cho kết quả ngang ngửa hoặc vượt qua các phương pháp tái tạo pixel như MAE, dù tốn ít thời gian tiền huấn luyện hơn nhiều. Nó cũng học tốt với rất ít dữ liệu gán nhãn — chỉ cần vài mẫu mỗi lớp là đã đạt độ chính xác gần bằng huấn luyện có giám sát đầy đủ. Thú vị nhất là khi soi vào bản đồ chú ý (attention map) của một I-JEPA đã huấn luyện xong: mô hình tự khoanh được ranh giới vật thể, các bộ phận, thậm chí cả các nhóm ngữ nghĩa — dù chưa từng được dạy thế nào là "con chó" hay "bánh xe". Chỉ bằng việc cố đoán đặc trưng ẩn của những mảng bị che, nó buộc phải tự hình thành một cách hiểu nhất quán về thế giới. 6. Vì sao JEPA đáng chú ýJEPA không đơn thuần là một cải tiến nhỏ, mà mang theo một sự thay đổi tư duy khá rõ ràng:    • Tiết kiệm tính toán — không phải "vẽ lại" ở mức pixel, JEPA dồn toàn bộ năng lực vào việc hiểu ngữ nghĩa. I-JEPA đạt kết quả mạnh với thời gian GPU ít hơn hẳn so với các phương pháp tạo sinh hay đối chiếu khác.     • Không cần bày vẽ tăng cường dữ liệu — khác với SimCLR hay MoCo, JEPA không phụ thuộc vào một loạt phép biến đổi màu sắc, cắt ảnh, làm mờ để tạo cặp dữ liệu dương. Chính nhiệm vụ dự đoán đã tự cung cấp một tín hiệu học tập phong phú.     • Biểu diễn mang tính ngữ nghĩa, dễ diễn giải — các đặc trưng bên trong tự nhiên khớp với các bộ phận vật thể, thành phần cảnh vật, dù không hề có nhãn. Đây là nền tảng tốt cho các bài toán như phát hiện vật thể, phân đoạn ảnh, hay lập kế hoạch.     • Dùng chung một công thức cho nhiều loại dữ liệu — cùng một bản thiết kế JEPA áp dụng được cho ảnh (I-JEPA), video (V-JEPA), và cả âm thanh (A-JEPA). Meta cũng đang thử nghiệm các phiên bản JEPA đa phương thức, kết hợp thị giác, âm thanh, và cả hành động.

Vai trò của ESP32 + Jetson Nano trong một hệ thống AIoT?
ESP32 08 - 08 - 2026

Vai trò của ESP32 + Jetson Nano trong một hệ thống AIoT?

Khi xây dựng một hệ thống AIoT, lựa chọn phần cứng chỉ là bước đầu. Một vấn đề quan trọng hơn là xác định mỗi thiết bị nên chịu trách nhiệm cho phần nào của hệ thống. Đây là lý do các kiến trúc AIoT thường kết hợp nhiều lớp phần cứng. Một cấu hình tương đối phổ biến là sử dụng ESP32 cho tầng điều khiển thiết bị và một máy tính Edge AI như NVIDIA Jetson Nano cho tầng xử lý thông minh. ESP32 là một vi điều khiển tích hợp Wi-Fi và Bluetooth, được thiết kế để tương tác trực tiếp với các thiết bị điện tử và thế giới vật lý. Những tác vụ này thường không yêu cầu khả năng tính toán lớn. Thứ quan trọng hơn là độ ổn định, độ trễ thấp và khả năng hoạt động liên tục. if (temperature > threshold) { }

OpenCode + Ollama: AI Coding Agent local, không cần API, không cần cloud
Local LLM 06 - 08 - 2026

OpenCode + Ollama: AI Coding Agent local, không cần API, không cần cloud

Dạo gần đây mình để ý thấy cộng đồng dev nhắc khá nhiều đến một combo khá thú vị: OpenCode và Ollama. Nói ngắn gọn, OpenCode là một AI coding agent mã nguồn mở, chạy ngay trong terminal, có thể đọc project, sửa file, chạy lệnh giúp mình — na ná trải nghiệm của Claude Code hay Cursor. Còn Ollama thì quen thuộc hơn, là công cụ giúp tải và chạy các mô hình ngôn ngữ (LLM) ngay trên máy cá nhân, không cần gửi gì lên cloud. Mình cũng đã có cơ hội được phép sử dụng các model của ollama kết hợp với opencode tại server của SIU AI lab, loại mà do các anh chị cài đặt. Cảm thấy sử dụng rất tốt, ngoài việc sử dụng miễn phí ra thì còn cảm nhận được cái tốt của việc có một AI đọc file, viết code, quản lý, v. v. . Dĩ nhiên đây không phải "chén thánh" thay thế hoàn toàn các agent cloud lớn — model local vẫn còn giới hạn tuỳ vào cấu hình máy. Nhưng với các tác vụ hằng ngày, việc có một agent riêng tư, miễn phí, sẵn sàng dùng offline vẫn là một hướng đi rất đáng thử, đặc biệt với ai quan tâm đến bảo mật code hoặc chỉ đơn giản muốn tiết kiệm chi phí. Tổng kếtOpenCode kết hợp Ollama cho thấy một xu hướng rõ ràng: AI coding agent không còn là "đặc quyền" của các nền tảng trả phí, mà hoàn toàn có thể tự dựng và làm chủ ngay trên máy cá nhân. Phù hợp với các bạn sinh viên không có chi phí để sở hữu cho mình một AI mãnh mẽ nhưng vẫn có thể trả nghiệm cảm giác của một AI mạnh.

GraphRAG: Nâng Tầm RAG với Đồ Thị Tri Thức
RAG 30 - 06 - 2025

GraphRAG: Nâng Tầm RAG với Đồ Thị Tri Thức

RAG truyền thống vẫn còn nhiều hạn chế: Thiếu khả năng hiểu khái niệm tổng quát: Khi người dùng yêu cầu một câu trả lời mang tính khái quát, tổng hợp từ nhiều tài liệu lớn hoặc từ các chủ đề rộng, RAG không đủ khả năng nhận diện và tổng hợp các khái niệm ngữ nghĩa ở cấp độ cao. RAG truyền thống (dựa trên vector search) sẽ hoạt động bằng cách: Tìm các đoạn văn bản có độ tương đồng ngữ nghĩa cao với câu hỏi. Đưa những đoạn đó vào LLM để sinh câu trả lời.