블로그 딥다이브 · 소식 · 작업로그 전체 딥다이브 소식 작업로그 딥다이브 DEEP DIVE 논문과 기술을 수식·실험까지 따라가며 뜯어본 심층 리뷰. 딥다이브 2026.07.14 학생은 튜터를 설계자 뜻대로 안 쓴다 — 교육 AI를 평가 방법론으로 다시 읽기 만족도·engagement로 교육 AI를 평가하면 실제 학습 목표를 못 봅니다. ACL 2026 논문의 여섯 지표와 turn별 측정을 eval 방법론 관점에서 뜯어봤습니다. eval llm-as-judge agents education 소식 NEWS 새 모델·제품·릴리스에 대한 짧은 관점과 메모. 소식 2026.07.10 GPT-5.6에서 먼저 볼 것: 모델 등급보다 tool calling 경로 GPT-5.6은 Sol·Terra·Luna 세 등급으로 나뉩니다. sympo에서는 모델 라우팅보다 programmatic tool calling의 관측 가능성이 먼저 검증할 항목입니다. gpt-5.6 llm agents 작업로그 LOG sympo·token-stack 같은 내 프로젝트의 엔지니어링 기록. 작업로그 2026.07.13 멀티에이전트 eval에서 먼저 정할 세 가지: 게이트·환경·판정 sympo의 PRD→WBS 파이프라인에서 검증 게이트, 평가 환경, LLM-as-judge를 함께 설계하는 기준을 정리합니다. eval multi-agent agents llm-as-judge
딥다이브 2026.07.14 학생은 튜터를 설계자 뜻대로 안 쓴다 — 교육 AI를 평가 방법론으로 다시 읽기 만족도·engagement로 교육 AI를 평가하면 실제 학습 목표를 못 봅니다. ACL 2026 논문의 여섯 지표와 turn별 측정을 eval 방법론 관점에서 뜯어봤습니다. eval llm-as-judge agents education
소식 2026.07.10 GPT-5.6에서 먼저 볼 것: 모델 등급보다 tool calling 경로 GPT-5.6은 Sol·Terra·Luna 세 등급으로 나뉩니다. sympo에서는 모델 라우팅보다 programmatic tool calling의 관측 가능성이 먼저 검증할 항목입니다. gpt-5.6 llm agents
작업로그 2026.07.13 멀티에이전트 eval에서 먼저 정할 세 가지: 게이트·환경·판정 sympo의 PRD→WBS 파이프라인에서 검증 게이트, 평가 환경, LLM-as-judge를 함께 설계하는 기준을 정리합니다. eval multi-agent agents llm-as-judge